AllDSH

使用场景

视觉与 OCR

让纯文本智能体检查图片、截图、图表和扫描页。

视觉插件给纯文本模型提供了一种”看”的方式。最强的实现不只是描述一张图片,而是返回模型可以据此推理的结构化证据:带位置的抽取文本、版面区域、颜色值,以及它接下来可以请求的裁剪坐标。

优先选择把图片当作普通工具调用而不是特殊回合类型的插件,并检查视觉后端是本地、免费,还是需要你自己的 key。对于截图很多的工作,要确认长图是被分块处理,而不是被缩小到无法辨认。

3 个插件

liustack avatar

Modlens

liustack

编辑推荐

为纯文本 Harness 提供的视觉能力:粘贴一张图片,即可获得覆盖 OCR、布局与语义的结构化 JSON 证据。

L5 gold Scanned
3.9k TypeScript 3 天前
ysr666 avatar

Vision Router

ysr666

为纯文本 agent 提供视觉能力,内置免费的视觉链路,以及用于定位、裁剪和 diff 的像素级工具。

L5 gold Scanned
1.1k JavaScript 2 天前
Anionex avatar

Vision Toolkit

Anionex

面向纯文本模型的视觉工具箱,覆盖图像问答、长截图 OCR、UI 还原和定位。

L4 silver Scanned
853 TypeScript 6 天前

相关入口

ESC

Type to search the index. Built at deploy time by Pagefind.