近几年 TTS 发展极快,而我的技术直觉还停留在 FastSpeech 阶段。最近项目重新需要用到 TTS,我便选取了一些近期在资料、仓库和讨论中反复出现,且本地相对容易接入的模型,做了一次面向实际使用的梳理和评测。

需要说明的是,这不是传统 MOS 测试,也不试图给出学术 Benchmark 式结论。我更关心工程使用中会反复遇到的问题:

  • 中文断句是否合理

  • 专有名词读法是否准确

  • 中英混读是否自然

  • 数字和符号处理是否完整

  • 情绪表达是否克制恰当

  • 长文本是否截断、漏段或乱序

  • 推理成本与显存占用

因此,本文的评分带有明确的任务偏好,难免有失偏颇,更适合作为一次个人视角的选型记录,而不是通用排行榜。最终进入 No-prompt 纯文本 TTS 核心横评的 6 个模型:

CosyVoice·GLM-TTS·MAGIC-TTS·OmniVoice·Qwen3-TTS·VoxCPM2

其余模型定位:Kimi-Audio/VibeVoice属语音基础模型/长音频方向,暂不可比;NaturalSpeech 3本地仍为占位。

01 模型分组与核心特点

技术分组
模型
作者
核心特点
离散Token / LLM TTS
CosyVoice [1]
阿里
Zero-shot TTS、音色克隆、情绪控制
离散Token / LLM TTS
Qwen3-TTS [2]
阿里
多语言、CustomVoice、VoiceDesign、流式
离散Token / LLM TTS
GLM-TTS [3]
智谱
音素级控制、流式推理、情感增强
语音基础模型
Kimi-Audio [4]
Moonshot
音频理解 + ASR + 对话 + 生成
语音基础模型
VibeVoice [5][6]
Microsoft
长音频ASR、多说话人TTS(本地中文不可比)
Diffusion/Flow
NaturalSpeech 3 [8]
微软亚洲
Diffusion/Latent、Reference Conditioning
Diffusion/Flow
MAGIC-TTS [9]
华南理工
Flow Matching、显式停顿/时长控制
多语种零样本
OmniVoice [7]
小米/k2-fsa
600+ 语言、批量合成、Voice Design
Tokenizer-free
VoxCPM2 [10]
OpenBMB
30 语言、Voice Design、48kHz 输出

02 核心技术对比

模型
架构类型
情感控制
Zero-shot
关键功能
CosyVoice
Codec + LLM
✅
✅
情绪/风格控制
Qwen3-TTS
LLM-based Codec
✅
✅
多语言 VoiceDesign、流式生成
Kimi-Audio
多模态 LLM
-
-
音频理解 + ASR
GLM-TTS
LLM + Flow
✅
✅
音素级控制、流式
OmniVoice
Diffusion LM
✅
✅
600+ 语言、批量推理
NaturalSpeech 3
Diffusion + Latent
✅
✅
因子化解编解码
MAGIC-TTS
Flow Matching
✅
待验证
停顿/时长控制

03 数据透明度与开源等级

  • 数据透明度(T0-T4):T4 为最高(来源/规模/流程全公开)

  • 开源完整度(O0-O4):O4 为最高(代码/权重/脚本齐全)

模型
公开音频规模
数据透明度
开源等级
备注
OmniVoice
58.1 万小时(600+ 语言)
T4
O4
完全来自 50 个开源数据集
CosyVoice
100 万+ 小时
T3
O4
覆盖 9 语言 + 18 方言
VoxCPM2
200 万+ 小时
T2
O4
30 语言、48kHz
Kimi-Audio
预训练 1300 万 + / SFT 30 万
T2
O4
结构清晰,含内部数据
Qwen3-TTS
500 万+ 小时
T2
O3
Post-training 规模未公开
GLM-TTS
10 万小时
T2
O3
Proprietary 数据
NaturalSpeech 3
20 万小时(内部)
T2
O1
核心数据不可复现
MAGIC-TTS
未公开
T1
O2
训练数据来源不明
VibeVoice
约 800 亿 Token
T2
O2
内部 Podcast 数据

04 训练过程与推理成本

三条技术路线简析:

1、Codec LM(CosyVoice / Qwen3 / GLM):

  • 路线: 波形 → 离散 Token → LM 预训练 → 多说话人训练 → Instruction Tuning

  • 验证重点:流式延迟、控制粒度、音色稳定性

2、Diffusion/Flow(NaturalSpeech 3 / MAGIC-TTS):

    • 路线:学习连续隐空间 → 条件生成训练 → Reference Conditionin

    • 验证重点:自然度、音色细节、推理成本

3、Speech Agent(Kimi-Audio / VibeVoice):

  • Audio-Text 多模态预训练 → Dialogue Alignment

  • 验证重点:语音助手体验、长音频理解

本地评测硬件环境

项目
配置
CPU
2 × AMD EPYC 7543 64-Core
内存
503 GiB
GPU
8 × NVIDIA RTX 5880 Ada (单卡 48 GiB)
评测口径
单任务 Wrapper, 非独占; 统一 Qwen3-ASR 回填
核心指标:
  • RTF(实时率):生成耗时 / 音频时长,越低越好

  • CER(字符错误率):ASR 转写 vs 原文

  • 峰值显存:运行期间 GPU 显存采样峰值

06 评测方法与样本设计

No-prompt 设置:模型仅输入正文text,考验"裸读"能力,而非显式指令跟随。

Core 样本集(31 条)

能力组
样本数
重点观察
韵律/停顿
4
无标点长句、多层嵌套、对比强调、停顿压力
情绪表达
3
弱情绪、轻微讽刺、段内情绪反转
细粒度控制
3
局部强调、逐字符慢读、段落风格切换
中英混读
3
技术术语、整句切换、多语言地名
专名/数字符号
5
人名、模型名、日期/金额/URL/邮箱/公式
长文本
3
结构化长文、无标点长文、5x/10x 长时压力
稳定性
3
同句多次、同音色不同文本、情绪变化保持音色

07 No-prompt Core 实测结果

运行完成情况,全部186 条(6 模型 × 31 样本)成功率 100%。

RTF 与显存实测

模型
RTF 均值
峰值显存均值
评价
CosyVoice
0.704
11.1 GB
🥇 最快
VoxCPM2
1.223
33.2 GB
速度适中,显存最高
OmniVoice
1.714
23.0 GB
显存稳定
Qwen3-TTS
1.870
6.3 GB
显存最低
MAGIC-TTS
3.242
7.0 GB
偏慢
GLM-TTS
14.694
10.1 GB
受加载开销影响
文本跟随准确性(CER)
排名
模型
平均CER
评价
🥇
VoxCPM2
0.0653
几乎无错读漏读
🥈
OmniVoice
0.0785
极佳
🥉
GLM-TTS
0.1158
优秀
4
Qwen3-TTS
0.1563
一般
5
CosyVoice
0.2537
中短句好,长文拖累
6
MAGIC-TTS
14.6915
❌ 严重不稳

人工听测汇总(0-5 任务完成度)

各样本目标不同(P 看断句、E 看情绪克制、TN 看信息完整性),分数只在同一能力组内横向比较。

1、韵律/停顿

样本
最佳
得分
次优
P01 无标点长句
CosyVoice
5
VoxCPM2(4)
P02 多层嵌套
CosyVoice
5
VoxCPM2(4)
P03 对比强调
VoxCPM2
5
CosyVoice(4)
P04 停顿压力
GLM-TTS / Qwen3
4
—
2、情绪表达
样本
最佳
得分
说明
E01 弱情绪
CosyVoice / GLM-TTS / VoxCPM2
5
克制专业感最强
E02 轻微讽刺
CosyVoice
5
最佳,不夸张
E03 情绪反转
VoxCPM2
5
段内变化最自然
3、细粒度控制
样本
最佳
得分
说明
C01 局部强调
VoxCPM2
4
只强调目标词
C02 逐字符慢读
OmniVoice
4
全模型偏难,相对最好
C03 段落风格切换
VoxCPM2
5
切换最干净
4、中英混读 / 专名
样本
最佳
得分
说明
CS01 技术术语
GLM-TTS / VoxCPM2
5
最稳
CS02 整句切换
全员
4-5
普遍表现好
CS03 多语言地名
VoxCPM2
4
外文发音可辨
PN01 人名
OmniVoice / VoxCPM2
5
读法稳定
PN02 模型名/版本
GLM-TTS
4
连字符/数字最稳
5、数字 / URL / 公式
样本
最佳
得分
说明
TN01 日期/金额/电话
OmniVoice
4
全模型弱项,相对最好
TN02 URL/邮箱/配置
VoxCPM2
4
完整性最好
TN03 公式/单位
GLM-TTS / Qwen3 / VoxCPM2
3
均需前处理
⚠️数字/URL/公式是全模型共同弱项,建议做文本归一化前处理。
6、长文本
样本
最佳
得分
说明
L01 结构化长文
VoxCPM2 / GLM-TTS / OmniVoice
5
完整读完
L02 无标点长文
VoxCPM2
5
断句合理
L03_5x / 10x 长时压力
VoxCPM2 / GLM-TTS / OmniVoice
4
三者可用;CosyVoice 截断严重
7、稳定性 / 音色一致
样本
最佳
得分
说明
V01 同句稳定性
全员(除OmniVoice)
5
均稳定
V02 同音色不同文本
CosyVoice
4
音色保持最好
V03 情绪变化不丢音色
CosyVoice
4
唯一可用;VoxCPM2 仅1分

08 关键结论

1、普通场景主观结论

模型
判断
主要依据与风险
CosyVoice
普通中文中短句首选
P01/P02 断句、E01/E02 克制情绪、V01-V03 音色稳定均最强。短板:数字/长文本弱,需前处理
VoxCPM2
综合任务完成度最强
文本跟随、中英混读、长文本、局部控制突出。风险:讽刺偏弱、情绪音色漂移、显存33GB
GLM-TTS
复杂文本/长文本备选
长时压力、技术术语、模型名/版本最稳。短板:普通听感不如 CosyVoice
OmniVoice
多语言/长文本方向保留
整句切换、人名、日期金额有亮点。风险:稳定性任务音色波动
Qwen3-TTS
不建议主力
整体完成度偏低
MAGIC-TTS
排除候选池
文本跟随严重不稳
2、压力测试结论
压力维度
首选
备选
韵律/断句
CosyVoice
VoxCPM2
情绪表达
CosyVoice
VoxCPM2
细粒度控制
VoxCPM2
OmniVoice
中英/多语言
VoxCPM2 / GLM-TTS
OmniVoice
数字/URL
需前处理
所有模型均不可裸读
长文本
VoxCPM2 / GLM-TTS / OmniVoice
—
音色稳定
CosyVoice
GLM-TTS / Qwen3
推理成本
CosyVoice (RTF 最低)
Qwen3 (显存最低)
3、最终接入建议
任务类型
首选
备选
自然中文短中句 / 客服播报
CosyVoice
—
复杂文本 / 长文本 / 高文本跟随
VoxCPM2
GLM-TTS
多语言合成 / 数据生产
OmniVoice
—
URL / 数字 / 公式
必须做文本归一化前处理
所有模型
编辑:Toughman
审核:Efímero,Ryuk

参考文献:

[1]. Zhihao Du et al.CosyVoice 3. arXiv:2505.17589, 2025.

[2]. Hangrui Hu et al.Qwen3-TTS. arXiv:2601.15621, 2026.

[3]. Jiayan Cui et al.GLM-TTS. arXiv:2512.14291, 2025.

[4]. Kimi Team et al.Kimi-Audio. arXiv:2504.18425, 2025.

[5]. Zhiliang Peng et al.VibeVoice. arXiv:2508.19205, 2025.

[6]. Zhiliang Peng et al.VIBEVOICE-ASR. arXiv:2601.18184, 2026.

[7]. Han Zhu et al.OmniVoice. arXiv:2604.00688, 2026.

[8]. Zeqian Ju et al.NaturalSpeech 3. arXiv:2403.03100, 2024.

[9]. Jialong Mai et al.MAGIC-TTS. arXiv:2604.21164, 2026.

[10]. Yixuan Zhou et al.VoxCPM2. arXiv:2606.06928, 2026.