字
字节笔记本
2026年9月18日
agent-vision-toolkit:给纯文本 agent 装眼睛的中文开源视觉工具箱
API中转
¥120
本文介绍 Anionex 开源的 agent-vision-toolkit(1.2 千 stars,MIT,中文文档)——给纯文本 coding agent 装"眼睛"的视觉工具箱:图像问答、长截图 OCR、前端 UI 还原、GUI 自动化,做成一套视觉 CLI 加一个 agent skill,DeepSeek 这类文本模型的 agent 也能干多模态的活。
项目简介
它的出发点很妙:"agent 的视觉能力不一定住在模型里,也可以住在 harness 里。" 你的 agent 跑在 DeepSeek 等纯文本模型上,看不了图、图像工具还被系统拦——这个仓库用"外部工具 + 技能指引"的组合拳补齐:模型提议看什么,CLI 工具真正去看、去看懂、把结构化结果带回来。
核心是两类组件:视觉工具 CLI(任何能调 shell 的 agent 都能用)+ skill(教 agent 什么时候用哪个工具);另有可选的本地透明代理做无缝集成(支持 Codex、Claude Code、Pi、Oh My Pi、OpenCode)。
核心能力
- 图像问答:直接识别粘贴的图片
- 长截图 OCR:整页截图文字提取,坐标可点
- 前端 UI 还原:从设计图/截图生成前端代码
- GUI 自动化:定位屏幕元素并操作
- 兼容 agentskills.io 标准:skill 可装进任何支持的 agent
快速开始
克隆仓库后按 README 安装 CLI 与技能;接主流 agent 走 extensions 目录里的对应集成。装完对 agent 说"看这张图"之类的话,它会自己挑合适的视觉工具。
适用场景
- DeepSeek/纯文本模型用户:不换模型获得多模态体验,甚至比原生多模态更可控
- 前端开发:UI 截图还原代码
- 桌面自动化:配合 GUI 自动化能力做端到端操作
注意事项
- 视觉理解质量取决于你配置的底层视觉模型(工具调用的"眼睛"是外接的)
- 透明代理集成属可选升级,配置项较多,先从 CLI + skill 方式起步
- 中文文档友好,国内用户上手成本低
项目链接
- GitHub 仓库:https://github.com/Anionex/agent-vision-toolkit
- 中文文档:仓库 README_CN.md
分享: