视觉是本周的主题。三个不同的工具包在几天之内相继发布,趋势现在已经很清楚:对于无法看见的模型,生态已经认定结构化证据而不是散文式描述才是正确的输出。
Modlens 领跑视觉阵营
Modlens 更新了更精细的版面切分,其 JSON 证据格式现在已成为其他视觉插件正在趋同的参考实现。带坐标和区域标签的文本,加上一个能让模型要求放大细看的裁剪工具,是比“描述这张图片”根本更好的接口约定。
Vision Router 与 Vision Toolkit 双双发布
Vision Router 在工具集中加入了像素比对,使视觉回归检查成为一次普通的工具调用,而不是一套专门定制的工作流。Vision Toolkit 改进了长截图分块,这正是此前让 OCR 在整页截图上失效的故障模式。
零密钥方案在这里很重要:两者都自带一条免费的视觉链路,这也解释了它们的安装量。
上下文工具悄然成为必需
DSH Context 的排名持续上升。原因很实际:一旦会话超过一小时,了解窗口里有什么就不再是好奇心,而变成必要的维护工作。它的构成视图和压缩事件日志是人们提到最多的两个功能。
一次值得锁定版本的记忆插件发布
Memento 发布了一次 schema 调整。如果你依赖它的快照格式,请锁定版本,因为早期版本仍在不断调整。写入审批门槛依然是它区别于记忆类其他插件的关键功能。
同样值得一看
Background Agents 发布了一个持久性修复,使子智能体在页面刷新后依然存活;MisakaNet 则继续充实其共享的调试经验库。
我们关注的事项
下周有两件事值得关注:界面插件能否跟上最新的预览版发布,以及是否有视觉插件会采用共享的证据 schema,而不是三个略有差异的 JSON 结构。