目录条目
Anionex
agent-vision-toolkit 插件:面向纯文本模型的视觉工具
Agent Vision Toolkit 为纯文本模型提供视觉工具和技能,支持图像问答、OCR、UI 还原和 GUI 自动化,并可选择集成多个代理。
这个插件能做什么
agent-vision-toolkit 插件是一个为纯文本 LLM 设计的视觉工具包和技能。它支持图像问答、长截图 OCR、前端 UI 还原和 GUI 自动化。它提供对 Codex、Claude Code、Pi、Oh My Pi 和 OpenCode 的可选无缝集成,使纯文本模型能够有效处理视觉任务。
agent-vision-toolkit 插件提供视觉工具 CLI 和一个技能,教代理何时使用每个工具。它支持粘贴图像和内置图像工具。该工具包包括意图感知的图像问答、接地、检测、跟踪、裁剪、像素差异、长截图 OCR、前景提取、主色分析和 HTML 截图。它提供了一个透明的本地代理和单文件原生插件,用于无缝集成。该项目已在真实的 Codex 和 DeepSeek 会话中验证。
文档记录的能力
意图感知图像问答
agent-vision-toolkit 插件在查看图像时捕获用户或模型的最新意图,生成当前轮次所需的细节,而不是宽泛的描述。
长截图 OCR
它可以通过查找低内容剪切带、按顺序 OCR 每个块、保留说话者和时间戳以及合并重叠来提取长截图、聊天记录和滚动页面。
UI 还原和 GUI 自动化
该插件可以从截图或设计重建 UI,还原图标和图形,并通过定位控件和验证状态变化来从截图操作 GUI。
实际使用场景
从截图重建 UI
使用 agent-vision-toolkit,代理可以重用项目组件和资源,结合代码原生 UI、提取的视觉和视觉比较来对齐页面或组件。
提取长截图
该插件可以通过按顺序 OCR 块、保留说话者和时间戳以及合并重复重叠来处理长截图和聊天记录。
从截图操作 GUI
代理可以定位控件、执行操作、再次捕获屏幕并验证结果状态,从而实现 GUI 自动化。
安装前先审查
信任第三方插件前,请阅读源码、近期发布、所需权限、网络访问范围与维护者历史。
常见问题
什么是 agent-vision-toolkit?
agent-vision-toolkit是一个为纯文本 LLM 设计的视觉工具包和技能,提供图像问答、OCR、UI 还原和 GUI 自动化,并可选择集成多个代理。
哪些代理可以集成 agent-vision-toolkit?
它提供对 Codex、Claude Code、Pi、Oh My Pi 和 OpenCode 的可选无缝集成。它还支持 DeepSeek Harness 作为原生 Profile Bundle。
agent-vision-toolkit如何处理图像?
它支持粘贴图像和内置图像工具。包含的技能教代理检查什么、选择哪个工具以及如何验证结果。