你平时用的那个只能读文字的AI,碰到截图是不是就没法处理了?agent-vision-toolkit 这个工具箱,就是给这类纯文本AI加上视觉功能的。它能让你的AI助手理解图片内容,不管是分析界面截图,还是帮你找屏幕上的特定按钮,都可以做到。
这个项目在 GitHub 上发布没多久,目前有 310 个 star。它不是一个复杂的平台,就是一套命令行工具加上一个“技能”包,让你现有的AI立刻具备看图片的能力。
适合谁
第一类,是那些正在用 Codex、Claude Code、Pi、OpenCode 这类AI编程助手的人。如果你的AI经常因为看不懂报错截图或者设计稿而没法继续,这个工具可以帮你。
第二类,是喜欢自己动手搭建工作流的人。你不需要多厉害的编程水平,但得愿意在命令行里敲几条命令,设置一下环境变量。工具本身不复杂,主要是把调用视觉模型(比如 Gemini)的过程给打包好了。
能解决什么问题
最直接的就是截图问答。比如你截了一张软件界面图发给AI,问它“这个按钮是什么颜色?”或者“这两个输入框的标签对不对得上?”。以前AI只能猜,现在它能“看到”并给出准确的描述。
另一个实用的场景是屏幕元素定位。README里有个下象棋的例子:让DeepSeek-V4通过这个工具“看到”棋盘,然后自动操作。这个思路可以用在很多自动化任务上,比如让AI帮你点击屏幕上某个固定位置的按钮。
还有一个常用功能:从图片里提取文字(OCR)。不管是截图里的错误代码,还是手机拍的文件照片,都能直接转成文本,扔给AI去处理或分析,省掉手动打字的步骤。
怎么开始用
最简单的办法,是把下面这段话直接复制给你的AI助手(比如Codex),让它自己去处理:
Read https://github.com/Anionex/agent-vision-toolkit and set it up on this machine: the vision toolkit and skill, plus the seamless integration per AGENT_INSTALL.md if my host supports it.
如果你习惯自己动手,三步就能装好:
- 准备一个视觉API。在
~/.config/agent-vision-toolkit/env文件里配好下面三个环境变量(记得用chmod 600保护一下文件):
```bash
VISION_API_KEY=sk-你的密钥
VISION_BASE_URL=https://你的API服务地址
VISION_MODEL=google/gemini-3.6-flash # 或者其他支持的模型
```
它支持所有兼容OpenAI格式的视觉API,比如阿里云的灵积。
- 下载工具到本地:
```bash
git clone https://github.com/Anionex/agent-vision-toolkit.git
export PATH="$PWD/agent-vision-toolkit/bin:$PATH"
```
- 给你的AI安装“视觉技能”:
```bash
npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y
```
或者,你也可以手动把 skills/vision-tools/ 文件夹复制到AI的技能目录里。
优点和坑
优点有这些:
一是无缝集成。装好以后,你直接在聊天窗口贴图片,或者AI自己调用view_image函数,都会自动触发视觉分析,不需要你再额外提醒。
二是描述有重点。它不会生成一段笼统的图片介绍,而是结合你当前的问题,给出针对性的描述。比如你问按钮颜色,它就重点说颜色。
三是处理多张图很快。一次性扔给它多张图片,它会并行处理,比一张张等快不少。
需要注意的坑:
第一个是要自己准备视觉API。工具本身免费,但调用Google Gemini、Qwen-VL这些模型需要你自己的账号和额度,会产生费用。这是最主要的成本。
第二个是部分工具有额外依赖。基础的glance命令只需要Python环境,但像ground、trace(图片转SVG)这些高级工具,需要额外安装pillow、vtracer这些库,得自己准备好环境。
第三个,作者也明确说了:视觉模型只负责“看”和“描述”,不负责“推理”。得出结论、分析对错,还是要靠你原来的文本AI(比如DeepSeek)。它只是提供了更准确的“视觉情报”。
第四个是新项目的常见问题。项目创建于2026年8月初,虽然最近有更新,但毕竟刚开始。以后功能会不会增加、文档会不会更全,得看作者的维护情况。
适合你吗
如果你已经在用Codex、Claude Code这类AI编程助手,又总被截图问题卡住,这个工具箱能直接派上用场。集成起来不复杂,成本就是自己配一个视觉API的密钥。
要是完全不想碰命令行和配置,那它确实不合适。这不是一个独立软件,它只负责给你手里的AI加上“眼睛”。
项目8月初刚发布,现在有310个star,README写得很清楚。从实际效果看,花点时间配好之后,最实用的就是能让AI准确描述截图里的按钮、文字或者报错信息,不用再靠猜。视觉模型偶尔会漏掉一些细节,但比你手动打字要方便得多。

常见问题
Agent Vision 工具箱是免费的吗?需要什么额外成本?
工具本身开源免费,但核心功能依赖视觉模型 API。你需要自己注册并充值像 Google Gemini、阿里云灵积这类服务,会产生 API 调用费用。这是主要成本,具体花多少钱取决于你选的模型和调用量。
Agent Vision 工具箱支持哪些视觉模型?
它支持所有兼容 OpenAI 格式的视觉 API。官方例子用的是 google/gemini-3.6-flash,但你也可以配置阿里云灵积、Qwen-VL 这些。只要在环境变量 VISION_MODEL 里指定好模型路径就行。
Agent Vision 工具箱的安装配置复杂吗?
对用命令行的人来说不复杂。核心就三步:1. 配置好带 API 密钥的 env 文件;2. git 克隆项目;3. 运行 npx skills add 命令安装视觉技能。需要基本的终端操作能力和获取 API 密钥的能力。
Agent Vision 和 Umi-OCR 在 OCR 功能上有什么区别?
Agent Vision 的 OCR 是集成在 AI 工作流里的一个环节,需要调用在线 API,适合和 AI 助手联动分析。Umi-OCR 是独立、离线、带界面的免费软件,适合在本地批量处理图片,两者的定位不一样。
Agent Vision 工具箱能识别图片中的按钮并自动点击吗?
工具本身提供‘看’和‘描述’的能力(比如用 ground 命令定位元素)。要实现‘自动点击’,需要搭配像 Browser-use 这样的自动化工具,由 AI 根据看到的视觉信息去驱动操作。
Agent Vision 工具箱怎么下载安装?具体步骤是什么?
下载安装分三步:1. 准备视觉 API,在 `~/.config/agent-vision-toolkit/env` 文件里配置 `VISION_API_KEY`、`VISION_BASE_URL` 和 `VISION_MODEL` 三个环境变量。2. 下载工具,在命令行运行 `git clone https://github.com/Anionex/agent-vision-toolkit.git` 并设置环境变量。3. 安装视觉技能,运行 `npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y` 或手动复制技能文件夹。
Agent Vision 对电脑配置有什么要求?需要自己装 Python 吗?
对基础配置要求不高。核心的 `glance` 命令只需要 Python 环境。但像 `ground`、`trace`(图片转 SVG)这些高级工具,需要额外安装 `pillow`、`vtracer` 等库,你得自己准备好这些依赖环境。它不是一个独立软件,主要依赖命令行和你的视觉 API 密钥。
Agent Vision 工具箱能用来做什么?有什么具体的使用例子?
它能解决三个主要问题:1. **截图问答**:让 AI 分析界面截图,回答如“按钮是什么颜色?”等问题。2. **屏幕元素定位**:例如让 AI 看到棋盘后自动操作棋子,或点击屏幕上固定位置的按钮。3. **图片文字提取(OCR)**:将截图或照片中的错误代码、文件文字转成文本,供 AI 处理,省去手动打字。


