为纯文本 Harness 提供的视觉能力:粘贴一张图片,即可获得覆盖 OCR、布局与语义的结构化 JSON 证据。
L5 gold
Scanned
3.9k TypeScript 3 天前
使用场景
让纯文本智能体检查图片、截图、图表和扫描页。
视觉插件给纯文本模型提供了一种”看”的方式。最强的实现不只是描述一张图片,而是返回模型可以据此推理的结构化证据:带位置的抽取文本、版面区域、颜色值,以及它接下来可以请求的裁剪坐标。
优先选择把图片当作普通工具调用而不是特殊回合类型的插件,并检查视觉后端是本地、免费,还是需要你自己的 key。对于截图很多的工作,要确认长图是被分块处理,而不是被缩小到无法辨认。
为纯文本 Harness 提供的视觉能力:粘贴一张图片,即可获得覆盖 OCR、布局与语义的结构化 JSON 证据。
ysr666
为纯文本 agent 提供视觉能力,内置免费的视觉链路,以及用于定位、裁剪和 diff 的像素级工具。
Anionex
面向纯文本模型的视觉工具箱,覆盖图像问答、长截图 OCR、UI 还原和定位。