ByteNoteByteNote
agent-vision-toolkit:给纯文本 agent 装眼睛的中文开源视觉工具箱

字节笔记本

2026年9月18日

agent-vision-toolkit:给纯文本 agent 装眼睛的中文开源视觉工具箱

API中转
¥120

本文介绍 Anionex 开源的 agent-vision-toolkit(1.2 千 stars,MIT,中文文档)——给纯文本 coding agent 装"眼睛"的视觉工具箱:图像问答、长截图 OCR、前端 UI 还原、GUI 自动化,做成一套视觉 CLI 加一个 agent skill,DeepSeek 这类文本模型的 agent 也能干多模态的活。

项目简介

它的出发点很妙:"agent 的视觉能力不一定住在模型里,也可以住在 harness 里。" 你的 agent 跑在 DeepSeek 等纯文本模型上,看不了图、图像工具还被系统拦——这个仓库用"外部工具 + 技能指引"的组合拳补齐:模型提议看什么,CLI 工具真正去看、去看懂、把结构化结果带回来。

核心是两类组件:视觉工具 CLI(任何能调 shell 的 agent 都能用)+ skill(教 agent 什么时候用哪个工具);另有可选的本地透明代理做无缝集成(支持 Codex、Claude Code、Pi、Oh My Pi、OpenCode)。

核心能力

  • 图像问答:直接识别粘贴的图片
  • 长截图 OCR:整页截图文字提取,坐标可点
  • 前端 UI 还原:从设计图/截图生成前端代码
  • GUI 自动化:定位屏幕元素并操作
  • 兼容 agentskills.io 标准:skill 可装进任何支持的 agent

快速开始

克隆仓库后按 README 安装 CLI 与技能;接主流 agent 走 extensions 目录里的对应集成。装完对 agent 说"看这张图"之类的话,它会自己挑合适的视觉工具。

适用场景

  • DeepSeek/纯文本模型用户:不换模型获得多模态体验,甚至比原生多模态更可控
  • 前端开发:UI 截图还原代码
  • 桌面自动化:配合 GUI 自动化能力做端到端操作

注意事项

  • 视觉理解质量取决于你配置的底层视觉模型(工具调用的"眼睛"是外接的)
  • 透明代理集成属可选升级,配置项较多,先从 CLI + skill 方式起步
  • 中文文档友好,国内用户上手成本低

项目链接

分享: