你平时用的那个只能读文字的AI,碰到截图是不是就没法处理了?agent-vision-toolkit 这个工具箱,就是给这类纯文本AI加上视觉功能的。它能让你的AI助手理解图片内容,不管是分析界面截图,还是帮你找屏幕上的特定按钮,都可以做到。

这个项目在 GitHub 上发布没多久,目前有 310 个 star。它不是一个复杂的平台,就是一套命令行工具加上一个“技能”包,让你现有的AI立刻具备看图片的能力。

适合谁

第一类,是那些正在用 Codex、Claude Code、Pi、OpenCode 这类AI编程助手的人。如果你的AI经常因为看不懂报错截图或者设计稿而没法继续,这个工具可以帮你。

第二类,是喜欢自己动手搭建工作流的人。你不需要多厉害的编程水平,但得愿意在命令行里敲几条命令,设置一下环境变量。工具本身不复杂,主要是把调用视觉模型(比如 Gemini)的过程给打包好了。

能解决什么问题

最直接的就是截图问答。比如你截了一张软件界面图发给AI,问它“这个按钮是什么颜色?”或者“这两个输入框的标签对不对得上?”。以前AI只能猜,现在它能“看到”并给出准确的描述。

另一个实用的场景是屏幕元素定位。README里有个下象棋的例子:让DeepSeek-V4通过这个工具“看到”棋盘,然后自动操作。这个思路可以用在很多自动化任务上,比如让AI帮你点击屏幕上某个固定位置的按钮。

还有一个常用功能:从图片里提取文字(OCR)。不管是截图里的错误代码,还是手机拍的文件照片,都能直接转成文本,扔给AI去处理或分析,省掉手动打字的步骤。

怎么开始用

最简单的办法,是把下面这段话直接复制给你的AI助手(比如Codex),让它自己去处理:

Read https://github.com/Anionex/agent-vision-toolkit and set it up on this machine: the vision toolkit and skill, plus the seamless integration per AGENT_INSTALL.md if my host supports it.

如果你习惯自己动手,三步就能装好:

  1. 准备一个视觉API。在 ~/.config/agent-vision-toolkit/env 文件里配好下面三个环境变量(记得用chmod 600保护一下文件):

```bash
VISION_API_KEY=sk-你的密钥
VISION_BASE_URL=https://你的API服务地址
VISION_MODEL=google/gemini-3.6-flash # 或者其他支持的模型
```

它支持所有兼容OpenAI格式的视觉API,比如阿里云的灵积。

  1. 下载工具到本地

```bash
git clone https://github.com/Anionex/agent-vision-toolkit.git
export PATH="$PWD/agent-vision-toolkit/bin:$PATH"
```

  1. 给你的AI安装“视觉技能”

```bash
npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y
```

或者,你也可以手动把 skills/vision-tools/ 文件夹复制到AI的技能目录里。

优点和坑

优点有这些:

一是无缝集成。装好以后,你直接在聊天窗口贴图片,或者AI自己调用view_image函数,都会自动触发视觉分析,不需要你再额外提醒。

二是描述有重点。它不会生成一段笼统的图片介绍,而是结合你当前的问题,给出针对性的描述。比如你问按钮颜色,它就重点说颜色。

三是处理多张图很快。一次性扔给它多张图片,它会并行处理,比一张张等快不少。

需要注意的坑:

第一个是要自己准备视觉API。工具本身免费,但调用Google Gemini、Qwen-VL这些模型需要你自己的账号和额度,会产生费用。这是最主要的成本。

第二个是部分工具有额外依赖。基础的glance命令只需要Python环境,但像groundtrace(图片转SVG)这些高级工具,需要额外安装pillowvtracer这些库,得自己准备好环境。

第三个,作者也明确说了:视觉模型只负责“看”和“描述”,不负责“推理”。得出结论、分析对错,还是要靠你原来的文本AI(比如DeepSeek)。它只是提供了更准确的“视觉情报”。

第四个是新项目的常见问题。项目创建于2026年8月初,虽然最近有更新,但毕竟刚开始。以后功能会不会增加、文档会不会更全,得看作者的维护情况。

适合你吗

如果你已经在用Codex、Claude Code这类AI编程助手,又总被截图问题卡住,这个工具箱能直接派上用场。集成起来不复杂,成本就是自己配一个视觉API的密钥。

要是完全不想碰命令行和配置,那它确实不合适。这不是一个独立软件,它只负责给你手里的AI加上“眼睛”。

项目8月初刚发布,现在有310个star,README写得很清楚。从实际效果看,花点时间配好之后,最实用的就是能让AI准确描述截图里的按钮、文字或者报错信息,不用再靠猜。视觉模型偶尔会漏掉一些细节,但比你手动打字要方便得多。

安装教程

常见问题

Agent Vision 工具箱是免费的吗?需要什么额外成本?

工具本身开源免费,但核心功能依赖视觉模型 API。你需要自己注册并充值像 Google Gemini、阿里云灵积这类服务,会产生 API 调用费用。这是主要成本,具体花多少钱取决于你选的模型和调用量。

Agent Vision 工具箱支持哪些视觉模型?

它支持所有兼容 OpenAI 格式的视觉 API。官方例子用的是 google/gemini-3.6-flash,但你也可以配置阿里云灵积、Qwen-VL 这些。只要在环境变量 VISION_MODEL 里指定好模型路径就行。

Agent Vision 工具箱的安装配置复杂吗?

对用命令行的人来说不复杂。核心就三步:1. 配置好带 API 密钥的 env 文件;2. git 克隆项目;3. 运行 npx skills add 命令安装视觉技能。需要基本的终端操作能力和获取 API 密钥的能力。

Agent Vision 和 Umi-OCR 在 OCR 功能上有什么区别?

Agent Vision 的 OCR 是集成在 AI 工作流里的一个环节,需要调用在线 API,适合和 AI 助手联动分析。Umi-OCR 是独立、离线、带界面的免费软件,适合在本地批量处理图片,两者的定位不一样。

Agent Vision 工具箱能识别图片中的按钮并自动点击吗?

工具本身提供‘看’和‘描述’的能力(比如用 ground 命令定位元素)。要实现‘自动点击’,需要搭配像 Browser-use 这样的自动化工具,由 AI 根据看到的视觉信息去驱动操作。

Agent Vision 工具箱怎么下载安装?具体步骤是什么?

下载安装分三步:1. 准备视觉 API,在 `~/.config/agent-vision-toolkit/env` 文件里配置 `VISION_API_KEY`、`VISION_BASE_URL` 和 `VISION_MODEL` 三个环境变量。2. 下载工具,在命令行运行 `git clone https://github.com/Anionex/agent-vision-toolkit.git` 并设置环境变量。3. 安装视觉技能,运行 `npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y` 或手动复制技能文件夹。

Agent Vision 对电脑配置有什么要求?需要自己装 Python 吗?

对基础配置要求不高。核心的 `glance` 命令只需要 Python 环境。但像 `ground`、`trace`(图片转 SVG)这些高级工具,需要额外安装 `pillow`、`vtracer` 等库,你得自己准备好这些依赖环境。它不是一个独立软件,主要依赖命令行和你的视觉 API 密钥。

Agent Vision 工具箱能用来做什么?有什么具体的使用例子?

它能解决三个主要问题:1. **截图问答**:让 AI 分析界面截图,回答如“按钮是什么颜色?”等问题。2. **屏幕元素定位**:例如让 AI 看到棋盘后自动操作棋子,或点击屏幕上固定位置的按钮。3. **图片文字提取(OCR)**:将截图或照片中的错误代码、文件文字转成文本,供 AI 处理,省去手动打字。

相关工具推荐

微信微博邮箱复制链接