你用的那个只会看字的AI,是不是一遇到截图就傻眼?agent-vision-toolkit 就是给这类纯文本AI装上眼睛的工具箱。它能让你的AI助手看懂图片里的内容,不管是分析界面截图,还是帮你找屏幕上的按钮,都行。

这个项目在 GitHub 上刚发布不久,已经有 310 个 star 了。它不是个复杂的平台,就是一套命令行工具和一个“技能”包,让你手头的AI瞬间获得视觉能力。

适合谁

第一类,是那些在用 Codex、Claude Code、Pi、OpenCode 这类AI编程助手的玩家。如果你的AI经常因为看不懂报错截图或设计稿而卡壳,这个工具就是为你准备的。

第二类,是喜欢自己动手折腾工作流的效率爱好者。你不需要多深的代码功底,但得愿意在命令行里敲几下,配置个环境变量。工具本身不复杂,核心是把调用视觉模型(比如 Gemini)的活儿给封装好了。

能解决什么问题

最直接的,就是截图问答。比如你截了个软件界面丢给AI,问它“这个按钮是什么颜色?”或者“这两个输入框的标签对得上吗?”。以前AI只能猜,现在它能“看到”并准确描述出来。

更实用的场景是屏幕元素定位。README里那个例子特别有意思:让DeepSeek-V4通过这个工具“看到”棋盘,然后自动操作下象棋。这思路可以延伸到很多自动化场景,比如让AI帮你点按屏幕上某个特定位置的按钮。

还有一个高频需求:从图片里提取文字(OCR)。无论是截图里的错误代码,还是手机拍的文件照片,都能一键转成文本,直接交给AI去处理或分析,省去了你手动打字的麻烦。

怎么开始用

最简单的办法,就是把下面这段话直接复制粘贴给你的AI助手(比如Codex),让它自己去搞定:

Read https://github.com/Anionex/agent-vision-toolkit and set it up on this machine: the vision toolkit and skill, plus the seamless integration per AGENT_INSTALL.md if my host supports it.

如果你习惯自己动手,三步就能装好:

  1. 准备一个视觉API。在 ~/.config/agent-vision-toolkit/env 文件里配置三个环境变量(记得chmod 600保护一下):

```bash

VISION_API_KEY=sk-你的密钥

VISION_BASE_URL=https://你的API服务地址

VISION_MODEL=google/gemini-3.6-flash # 或其他支持的模型

```

支持任何兼容OpenAI格式的视觉API,比如阿里云的灵积。

  1. 下载工具到本地

```bash

git clone https://github.com/Anionex/agent-vision-toolkit.git

export PATH="$PWD/agent-vision-toolkit/bin:$PATH"

```

  1. 给你的AI安装“视觉技能”

```bash

npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y

```

或者手动把 skills/vision-tools/ 文件夹复制到AI的技能目录里。

优点和坑

优点很明显:

一是无缝集成。装好之后,你直接在聊天窗口粘贴图片,或者AI自己调用view_image函数,都能自动触发视觉分析,不用你额外提醒。

二是描述有重点。它不会给你生成一段笼统的图片说明,而是结合你当前的问题,给出有针对性的描述。比如你问按钮颜色,它就重点描述颜色。

三是处理多张图很快。一次性丢给它多张图片,它会并行处理,速度比一张张等快很多。

坑也需要留意:

第一个坑是要自备视觉API。工具本身免费,但调用Google Gemini、Qwen-VL这些模型需要你自己有账号和额度,会产生费用。这是最大的使用成本。

第二个坑是部分工具有依赖。基础的glance命令只需Python,但像groundtrace(图片转SVG)这些高级工具,需要额外安装pillowvtracer等库,得自己弄一下环境。

第三个坑,作者也明说了:视觉模型只负责“看”和“描述”,不负责“推理”。得出结论、分析对错,依然得靠你原来的文本AI(比如DeepSeek)。它只是提供了更准确的“视觉情报”。

第四个是新项目的通病。项目创建于2026年8月初,虽然最近有更新,但毕竟刚起步。后续功能会不会增、文档会不会更完善,得看作者维护情况。

适合你吗

如果你已经在用Codex、Claude Code这类AI编程助手,又总被截图卡住,这个工具箱能直接解决问题。集成起来不麻烦,成本就是自己配个视觉API的密钥。

要是完全不想碰命令行和配置,那它确实不适合你。这不是个独立软件,它只负责给你手里的AI加上“眼睛”。

项目8月初刚发布,已经有310个star,README写得很清楚。我试下来觉得,花点时间配置好,最实用的就是能让AI准确描述截图里的按钮、文字或者报错信息,不用再靠猜。视觉模型偶尔会漏看些细节,但比你手动打字强多了。

安装教程

微信微博邮箱复制链接