VoxCPM2:免分词器的多语言语音生成模型
阅读完整评测深度教程 · 踩坑记录 · 常见问题
扫码查看

VoxCPM2 是一个开源的文本转语音模型,其核心亮点是采用免分词器设计,通过扩散自回归架构直接生成连续语音。它能帮助电商技术团队解决多语言语音合成的需求,支持包括英、中、日、韩等在内的30种语言及中文方言,无需拼接多个TTS服务。同时,它提供声音克隆和语音设计功能,适合开发多语言出海应用、有声书平台、配音工具、虚拟主播或个性化语音助手的团队。

VoxCPM2:免分词器的多语言语音生成模型

这是什么

VoxCPM2 是一个开源的多语言文本转语音模型,它跳过了传统的分词步骤,直接生成高质量语音。它能帮你用一个模型搞定30种语言的语音合成和声音克隆,无需整合多个服务。

核心能力

  • 多语言语音合成:直接输入文本,自动识别并合成30种语言的语音,包括英语、中文、日语、法语等主流语言及部分中文方言,输出48kHz高质量音频。
  • 可控声音克隆与设计:提供“可控克隆”功能,从短音频片段克隆音色、节奏和情感;支持“语音设计”,用自然语言描述生成新声音。
  • 开源商用友好:采用Apache-2.0协议,代码和模型权重完全开源,允许商业使用,无需额外付费。

适合谁

适合拥有GPU资源、需要将多语言TTS或声音克隆能力集成到自家产品(如出海应用、有声书平台、虚拟主播、个性化语音助手)的开发团队。不适合寻求一键式SaaS服务、不愿管理模型部署的用户。

获取方式

项目代码托管在GitHub,模型权重可在Hugging Face或ModelScope获取。你可以通过官方提供的在线Demo试听效果。

  • GitHub项目页:https://github.com/OpenBMB/VoxCPM
  • Hugging Face仓库:https://huggingface.co/openbmb/VoxCPM2
  • ModelScope仓库:https://modelscope.cn/models/OpenBMB/VoxCPM2
微信微博邮箱复制链接