Voicebox:开源AI语音工作室
分类:工具实测 浏览量:7
摘要:
Voicebox 是一个本地优先的开源 AI 语音工作室,它集成了 ElevenLabs 的语音合成和 WisprFlow 的语音输入能力,支持声音克隆、语音生成和全局听写,并能作为 AI 代理的语音输出接口。该工具帮助开发者和技术爱好者将整套语音输入输出流程本地化运行,数据不出本机且无需按字数付费,解决了使用云服务的成本和隐私问题。它特别适合开发语音应用(如语音笔记、播客剪辑、AI助手)、喜欢折腾本地部署的技术爱好者,以及需要为 MCP 兼容的 AI 代理(如 Claude Code、Cursor)添加语音能力的玩家。

Voicebox 是一个本地优先的开源 AI 语音工作室,把 ElevenLabs 的语音合成和 WisprFlow 的语音输入能力合并到了一起,支持克隆声音、生成语音、全局听写,还能顺便接给 AI 代理当嘴。对开发者来说,这意味着你可以在自己的机器上把整套语音输入输出流程跑起来,数据不出本机,也不用按字数付钱。
适合谁
做语音应用的开发者。不管是搞语音笔记工具、播客剪辑、还是给 AI 助手加个发声能力,Voicebox 把整个语音 I/O 栈本地化,你不用东拼西凑接两三个云服务。
折腾本地部署的技术爱好者。项目用 Tauri(Rust)构建而非 Electron,性能好不少,支持 macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm、Intel Arc,还能跑 Docker。
搞 AI Agent 的玩家。给 Claude Code、Cursor、Cline 这类 MCP 兼容的代理配一个 Voicebox 调用,就能让它们跟你说话——还是你克隆过的声音。这是 ElevenLabs 和 WisprFlow 单独都做不到的。
能解决什么问题
语音克隆不花云服务费用。给几秒音频就能零样本克隆声音,数据完全留在本机。官方描述是 few seconds of audio,不用像传统方案那样准备大量样本。
听写可以全局使用。默认全局快捷键唤起听写,push-to-talk 或 toggle 模式都有,macOS 上还能自动粘贴。Whisper 负责语音识别,准确度有保障。
给 AI 代理一个 "嗓子"。只需要一次工具调用 voicebox.speak,任何 MCP 感知的代理就能用你克隆的声音说话,还能给声音配个 persona,让代理用对应的性格回复。
整个项目目前 55300 star、6900 fork,MIT 协议,数据很硬。
怎么开始用
不同平台下载方式不同,直接去官方发布页或 voicebox.sh 拿安装包:
macOS(Apple Silicon)
# 下载 DMG
curl -L https://voicebox.sh/download/mac-arm -o voicebox.dmg
# 或者用 Homebrew
brew install --cask voicebox
Windows
# 用 winget 安装
winget install jamiepine.voicebox
Docker 部署
docker pull ghcr.io/jamiepine/voicebox:latest
docker run -d -p 8080:8080 ghcr.io/jamiepine/voicebox:latest
安装完启动后,图形界面里就能操作了。想用 API 或 MCP 集成,官方文档有完整的接口说明。
优点和坑
先说好的地方:
- 7 个 TTS 引擎可选:Qwen3-TTS、Chatterbox 系列、Kokoro 等,想用哪个用哪个,生成效果自行判断。
- 23 种语言覆盖,从英语、阿拉伯语到日语、印地语、斯瓦希里语都有,本地化业务基本够用。
- 音频后处理内置:音高偏移、混响、延迟、合唱、压缩、滤波都有,不用额外接 DAW。
坑也要说清楚:
- 本地跑大模型对硬件要求不低。官方覆盖了 CUDA 和 ROCm,但没写最低配置。如果是旧机器,7 个 TTS 引擎里重一点的模型(比如 Qwen3-TTS)可能跑不动或很慢。
- 安装方式偏开发者。Docker 有,winget/brew 有,但没有一键双击安装的傻瓜包——对不太熟悉命令行的普通用户不够友好。而且目前只有 macOS 和 Windows 的安装包,Linux 用户可能需要走 Docker。
- 自动分块处理长文,官方说是 auto-chunking with crossfade,但脚本超过一定长度时,合成速度会明显下降,边角有破音或停顿需要手动调整。
- 生态还年轻,GitHub 上 55300 star 虽然不少,但对比 ElevenLabs 的插件生态,Voicebox 目前第三方集成还集中在 MCP 生态,其他软件的原生接法不多。
适合你吗
适合:你本来就在折腾本地 AI 工具,会跑 Docker 或命令行,想要一套数据完全不出本机的语音合成/克隆/听写方案,愿意花时间调模型参数,也会自己解决环境依赖问题。
不适合:如果你就想要开箱即用、点开就会,或者需要多平台一键安装,那可能还是 ElevenLabs 这类云服务更省心。Voicebox 的价值在你愿意折腾配置之后才显现——它把主动权给了你,但不负责帮你把事情变简单。
常见问题
Voicebox 的官方网站和下载入口在哪里?
Voicebox 没有在线网站,它是一个本地应用。你可以直接访问官方项目页 voicebox.sh 获取安装包,或通过发布页下载。支持 macOS(用 curl 下载 DMG 或 Homebrew 安装)、Windows(用 winget 安装)以及 Docker 部署。
Voicebox 有安卓版可以下载吗?
根据文章内容,Voicebox 目前仅支持 macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm 和 Intel Arc 平台,可以通过 Docker 部署。文中没有提及安卓版本,因此暂时没有安卓版可供下载。
Voicebox 使用起来有哪些限制或缺点?
Voicebox 主要有三个限制:1. 对硬件要求高,本地跑大模型需要较好配置,旧机器可能跑不动重模型;2. 安装方式偏开发者,缺乏一键安装包,对普通用户不够友好;3. 处理长文本时合成速度会下降,可能出现破音,且第三方生态集成还比较年轻。
Voicebox 的模型文件应该放在哪个目录?
文章正文没有明确说明 Voicebox 模型的具体放置目录。通常这类本地 AI 工具会在首次运行时自动下载或由用户指定路径,建议查阅官方文档获取最准确的配置信息。
Voicebox 是免费的吗?和 ElevenLabs 相比怎么样?
Voicebox 是开源(MIT 协议)的本地工具,数据不出本机,因此没有按字数付费的云服务费用。它适合愿意折腾配置、追求数据隐私的开发者。而 ElevenLabs 作为云服务更开箱即用、省心,但需要付费且数据经过云端。
相关工具推荐
官方地址,点开新窗口;本文仅为工具介绍,与该项目无隶属关系。


