DSPlugin 首页DSPlugin
返回全部插件

目录条目

liustack

modlens 插件:为 DeepSeek Harness 纯文本模型提供视觉能力

为 DeepSeek Harness 与纯文本编程智能体提供视觉能力,从图片生成结构化 OCR、布局与语义证据。

这个插件能做什么

modlens 插件是 DeepSeek Harness 的视觉桥梁,使纯文本模型能够读取直接粘贴到聊天中的图片。它将图片转换为结构化 JSON 证据,包括 OCR、布局区域和语义细节,无需文件路径。

modlens 插件是 DeepSeek Harness 的首个视觉插件,旨在为纯文本模型提供视觉能力。它读取直接粘贴到聊天中的图片,将其转换为结构化 JSON 证据,包括完整转录、阅读顺序布局区域以及实体和关系列表。该插件复用 Claude Code、Codex、OpenCode 或 Pi 等工具中已有的多模态模型设置,也可使用 Antigravity CLI 或 Gemini 密钥等免费选项。modlens 插件已在多个 harness 的真实机器上验证,并为 DeepSeek 路由添加视觉模型选择项。

文档记录的能力

图片转 JSON 证据

modlens 插件将粘贴的图片转换为结构化 JSON 证据,包括 OCR 转录、布局区域和语义细节,使纯文本模型能够基于视觉内容进行回答。

零配置集成

modlens 插件复用 Claude Code、Codex、OpenCode 或 Pi 中已有的多模态模型配置,如果这些工具已配置,则无需额外设置。

多 Harness 支持

modlens已在 Claude Code、Codex、Pi 和 OpenCode 的真实机器上验证,可在不同 harness 环境中使用相同的视觉能力。

实际使用场景

01

读取截图

用户可以将截图粘贴到 DeepSeek Harness 中,modlens会转录内容,包括 UI 元素、文本和布局,供纯文本模型分析。

02

分析图表

modlens可以读取密集图表,如散点图,提取轴标签、刻度和高亮区域,这些通常对视觉桥梁具有挑战性。

03

处理多张图片

用户可以一次粘贴多张图片,modlens会依次读取,识别视觉家族并描述每张图片的内容和风格。

安装前先审查

信任第三方插件前,请阅读源码、近期发布、所需权限、网络访问范围与维护者历史。

常见问题

modlens如何处理粘贴的图片?

modlens直接读取粘贴到聊天中的图片,在请求时将其转换为结构化 JSON 证据。原始缩略图保留,模型基于提取的证据进行回答。

modlens支持哪些视觉引擎?

modlens复用 Claude Code、Codex、OpenCode 或 Pi 中的多模态模型(如果可用)。它还支持 Antigravity CLI 和 Gemini API 密钥等免费选项,以加快读取速度。

modlens是否兼容所有 DeepSeek 模型?

modlens包装 DeepSeek 和 GLM 纯文本模型。DeepSeek 自己的视觉模型会自动排除在包装之外,因为它们已经具备视觉能力。