来源丨新智元、AI小展厅
面壁智能2B小模型VoxCPM 2惊艳开源,一众外国网友疯狂了!30种语言与9大方言它是信手拈来,复刻的贺炜激昂解说与徐志胜脱口秀,相似度简直直击灵魂。这哪是工具,分明是降维打击的生产力核武器!

VoxCPM 2,面壁智能联合OpenBMB开源社区、清华大学人机语音交互实验室开发的2B小模型,4月刚刚开源。

体验链接:https://voxcpm.modelbest.cn/

GitHub开源链接:https://github.com/OpenBMB/VoxCPM/

Hugging Face链接:https://huggingface.openbmb.com/model/openbmb/VoxCPM2

模型核心能力包括:

  • 支持 30+ 语言及多种中文方言
  • 原生输出 48kHz 录音室级音质
  • 支持声音设计、声音克隆与流式生成
  • 可商用(Apache-2.0)

核心技术架构

1. 无分词器(Tokenizer-Free)语音建模

传统 TTS 依赖离散音频 token,而 VoxCPM2:

  • 直接在连续语音空间生成音频
  • 避免 tokenization 带来的信息损失

👉 带来的提升:

  • 音色更细腻
  • 情绪表达更自然
  • 韵律更接近真人

2. 扩散 + 自回归融合架构

模型融合两种生成范式:

  • 自回归(AR):建模语音结构(节奏/语序)
  • 扩散模型(Diffusion):细化音频质量

整体流程:

文本 → 语义建模 → 声学建模 → 扩散细化 → 音频输出

👉 优势:

  • 生成更稳定
  • 细节更丰富
  • 减少机械感

3. AudioVAE V2 音频编解码

  • 输入:16kHz
  • 输出:48kHz(原生高采样率)

特点:

  • 内置超分辨率能力
  • 无需外部上采样
  • 达到广播级音质

工程使用方式

Python 调用

from voxcpm import VoxCPM

model = VoxCPM.from_pretrained("openbmb/VoxCPM2")
audio = model.generate("你好,这是一个测试语音")

支持部署方式

  • Python API
  • 命令行工具(voxcpm)
  • Gradio Web UI
  • Nano-VLLM(高并发服务)


技术理想主义让中国AGI更有「声音」

VoxCPM 2能做到以上这些,底层是技术路线的选择。

目前开源TTS领域的主流技术路线是Token-based。把连续的语音信号先切成离散的声学Token,再用语言模型逐个预测。这个过程不可避免会丢失声学信息和情感细节。

VoxCPM 2走的是另一条路,扩散自回归连续表征。

用个类比来解释。

Token-based的方法像是先把一幅油画拍成马赛克照片,再试图从马赛克还原油画。每次「打马赛克」都会丢失一些色彩过渡的细节。

VoxCPM 2的方法是在连续的颜色空间里作画,不经过马赛克这一步。声音的细腻纹理天然保留得更完整。

落到听感上,差异很明显。

你去听VoxCPM 2克隆出来的声音,气息感、齿音、喉咙的震动,这些微妙的声学细节保留度好得多。

开头那段鲁迅的冷讽之所以能做到「不靠音量靠气息」,底层就是这条技术路线在撑着。

至此,AI语音的「暴力美学」时代正式结束,VoxCPM 2开启的是一个更细腻、更普惠的新时代。

这场比赛,已经被彻底杀死了。


参考资料:

https://voxcpm.modelbest.cn/

https://github.com/OpenBMB/VoxCPM/

https://huggingface.openbmb.com/model/openbmb/VoxCPM2