AllDSH
liustack avatar

Modlens

liustack · liustack/modlens

为纯文本 Harness 提供的视觉能力:粘贴一张图片,即可获得覆盖 OCR、布局与语义的结构化 JSON 证据。

本条目由 AllDSH 编辑部 核查,数据更新于 · 引用规则

L5 gold active Scanned

安装命令

dsh plugin --profile web add modlens

需要先启动 harness: npx @deepseek-ai/dsh web,然后执行上面的命令。 第一次用?先看安装教程。

功能说明

Modlens 是为无法“看见”的模型提供的视觉桥接层。它不会返回一段需要文本模型自行信任的自然语言描述,而是返回结构化的 JSON 证据:带位置的识别文本、布局区域,以及标注每个区域大致是什么的语义标签。模型随后可以基于这些证据进行推理、引用某个区域,或者要求给出更精确的裁剪。

主要特性

  • OCR 输出带有每个文本块的坐标,而不是一个扁平字符串
  • 布局分割,区分页眉、表格、代码、表单与媒体
  • 语义标签,使文本模型可以按名称引用区域
  • 同时支持粘贴的图片和工作区文件路径
  • 结构化输出可在后续的工具调用中继续传递

安装

dsh plugin --profile web add modlens

兼容性说明

超长截图适合先做分块处理;如果小字号文字识别结果出现乱码,请检查该插件的分块设置。

相似的 DSH 插件

查看全部
dsh-market avatar

DSH Market

dsh-market

DeepSeek Harness 内置的可视化插件市场,用于浏览、搜索和一键安装。

L5 gold Scanned
3.4k TypeScript 5 天前
ysr666 avatar

Vision Router

ysr666

为纯文本 agent 提供视觉能力,内置免费的视觉链路,以及用于定位、裁剪和 diff 的像素级工具。

L5 gold Scanned
1.1k JavaScript 2 天前
Anionex avatar

Vision Toolkit

Anionex

面向纯文本模型的视觉工具箱,覆盖图像问答、长截图 OCR、UI 还原和定位。

L4 silver Scanned
853 TypeScript 6 天前
ESC

Type to search the index. Built at deploy time by Pagefind.