VoxCPM 2,面壁智能联合OpenBMB开源社区、清华大学人机语音交互实验室开发的2B小模型,4月刚刚开源。
体验链接:https://voxcpm.modelbest.cn/
GitHub开源链接:https://github.com/OpenBMB/VoxCPM/
Hugging Face链接:https://huggingface.openbmb.com/model/openbmb/VoxCPM2
模型核心能力包括:
支持 30+ 语言及多种中文方言 原生输出 48kHz 录音室级音质 支持声音设计、声音克隆与流式生成 可商用(Apache-2.0)
核心技术架构
1. 无分词器(Tokenizer-Free)语音建模
传统 TTS 依赖离散音频 token,而 VoxCPM2:
直接在连续语音空间生成音频 避免 tokenization 带来的信息损失
👉 带来的提升:
音色更细腻 情绪表达更自然 韵律更接近真人
2. 扩散 + 自回归融合架构
模型融合两种生成范式:
自回归(AR):建模语音结构(节奏/语序) 扩散模型(Diffusion):细化音频质量
整体流程:
文本 → 语义建模 → 声学建模 → 扩散细化 → 音频输出
👉 优势:
生成更稳定 细节更丰富 减少机械感
3. AudioVAE V2 音频编解码
输入:16kHz 输出:48kHz(原生高采样率)
特点:
内置超分辨率能力 无需外部上采样 达到广播级音质
工程使用方式
Python 调用
from voxcpm import VoxCPM
model = VoxCPM.from_pretrained("openbmb/VoxCPM2")
audio = model.generate("你好,这是一个测试语音") 支持部署方式
Python API 命令行工具(voxcpm) Gradio Web UI Nano-VLLM(高并发服务)
技术理想主义让中国AGI更有「声音」
VoxCPM 2能做到以上这些,底层是技术路线的选择。
目前开源TTS领域的主流技术路线是Token-based。把连续的语音信号先切成离散的声学Token,再用语言模型逐个预测。这个过程不可避免会丢失声学信息和情感细节。
VoxCPM 2走的是另一条路,扩散自回归连续表征。
用个类比来解释。
Token-based的方法像是先把一幅油画拍成马赛克照片,再试图从马赛克还原油画。每次「打马赛克」都会丢失一些色彩过渡的细节。
VoxCPM 2的方法是在连续的颜色空间里作画,不经过马赛克这一步。声音的细腻纹理天然保留得更完整。
落到听感上,差异很明显。
你去听VoxCPM 2克隆出来的声音,气息感、齿音、喉咙的震动,这些微妙的声学细节保留度好得多。
开头那段鲁迅的冷讽之所以能做到「不靠音量靠气息」,底层就是这条技术路线在撑着。
至此,AI语音的「暴力美学」时代正式结束,VoxCPM 2开启的是一个更细腻、更普惠的新时代。
这场比赛,已经被彻底杀死了。
参考资料:
https://voxcpm.modelbest.cn/
https://github.com/OpenBMB/VoxCPM/
https://huggingface.openbmb.com/model/openbmb/VoxCPM2
