功能说明
Modlens 是为无法“看见”的模型提供的视觉桥接层。它不会返回一段需要文本模型自行信任的自然语言描述,而是返回结构化的 JSON 证据:带位置的识别文本、布局区域,以及标注每个区域大致是什么的语义标签。模型随后可以基于这些证据进行推理、引用某个区域,或者要求给出更精确的裁剪。
主要特性
- OCR 输出带有每个文本块的坐标,而不是一个扁平字符串
- 布局分割,区分页眉、表格、代码、表单与媒体
- 语义标签,使文本模型可以按名称引用区域
- 同时支持粘贴的图片和工作区文件路径
- 结构化输出可在后续的工具调用中继续传递
安装
dsh plugin --profile web add modlens
兼容性说明
超长截图适合先做分块处理;如果小字号文字识别结果出现乱码,请检查该插件的分块设置。