语音合成(TTS)领域长期存在一个矛盾:机器判断的“自然”与人类主观感受脱节。

这样的场景常常出现:你让AI生成一段语音,客观指标显示“完美”(如WER=0、FAD极低),但听起来却像机器人在背书。

如何让机器get到人类觉得“自然”的点?现有方案普遍陷入困境:

客观指标失效

WER(词错误率)、FAD(帧级别距离)等指标仅衡量“准确性”,与“自然度”无关;

预测模型拉垮

传统MOS预测器准确率不足60%,连最先进的AudioLLM(如Gemini-2.5-Flash)判断自然度也超不过70%;

人类反馈缺失

缺乏大规模人类对“自然感”的标注数据,导致模型无法学习人类的判断标准。
而本研究的核心目标:补充“人类反馈”,通过“数据集-评估基准-生成式奖励模型”三位一体方案,让机器真正理解“人类觉得什么是自然”。

「解决方案」

核心技术一:SpeechJudge-Data——大规模人类反馈数据集

高质量的标注数据是训练模型理解“自然度”的前提,SpeechJudge-Data通过系统性设计解决了数据规模与质量问题。

1.数据集构建策略


规模&覆盖度:包含99,000组语音对比样本(每组含2条语音及对应文本),覆盖全面:

TTS模型:覆盖3种架构的6个主流零样本模型(AR类的CosyVoice2、FM类的F5-TTS、MGM类的MaskGCT等),确保语音多样性;

风格:风格上涵盖常规语音(Emilia-Large数据集)、情感语音(ParaSpeechCaps情感库、原神角色语音)、带口音语音(L2-Arctic)及中英混码场景,确保风格多样性;

场景:场景上覆盖单语(如中-中、英-英)与跨语言(如中-英、英-混码)转换任务,模型、语音来源及语言分布均衡,确保场景多样性(图2)。

语音对来源:分“模型内对比”(同一TTS生成俩语音)和“模型间对比”(不同TTS生成),避免数据单调。

2. 标准化人类标注流程

标注团队:69名标注员(中文母语者、英语CET-6水平)经严格培训后上岗,历时2个月完成标注,累计投入约50万元人民币;

双维度标注任务:

数据质量筛选:

从99K原始数据中过滤“可懂度差异过大”样本(WER差距>12%,避免可懂度干扰自然度判断),得到44K高质量(hq)子集,进一步划分为42K训练集与1K验证集。

3. 标注一致性分析


标注结果分为完全一致(FA)、弱一致(WA)、弱分歧(WD)、完全分歧(FD)四类:
70%样本达成共识:
(51.5% FA + 17.2% WA),验证标注可靠性;
情感样本判断难度更高:
情感风格样本的FA比例(44.3%)低于常规样本(54.5%),反映人类对情感化语音自然度的主观差异更大。

核心技术二:SpeechJudge-Eval——自然度判断基准

为量化现有模型的自然度判断能力,SpeechJudge-Eval建立了标准化评估框架。

1. 基准任务定义

给定目标文本及两条语音样本(a1、a2),模型需判断“哪条语音更自然”,本质为二分类任务,以人类标注为金标准,通过准确率评估模型性能。

2. 基准数据集来源

从SpeechJudge-Data中选取1000对“完全一致(FA)”样本,分层覆盖常规/情感风格、中/英/混码语言,确保评估的公平性与代表性。

3. 现有模型测试表现


经过对现有4种常见模型的测试,结果显示:
客观指标(WER/FAD)准确率仅52%-58%(接近随机水平),跟人类感受完全不一致;
MOS预测器(如Cnn14-16k)准确率59.3%,无法分别细微差异;
Deepfake检测器准确率46.7,只能区分人类和机器,无法区分不同机器;
表现最佳的顶级AudioLLM(Gemini-2.5-Flash)准确率也只为69.1%——现有方法均未能有效捕捉人类对自然度的判断逻辑,凸显SpeechJudge方案的必要性。

核心技术三:SpeechJudge-GRM——生成式奖励模型

针对“机器如何学习人类自然度判断逻辑”这一关键问题,提出生成式奖励模型(GRM),实现可解释的自然度评估。

1. GRM创新点

基于Qwen2.5-Omni-7B AudioLLM,具备两大核心能力:
CoT推理(Chain-of-Thought):
生成自然度判断的逻辑分析(如“A节奏流畅无机械音,B存在明显卡顿”),提升模型可解释性;
推理缩放机制:
通过多次生成结果投票,进一步优化判断稳定性。

2. 两阶段训练流程

SFT阶段(冷启动):


针对Qwen2.5-Omni-7B指令跟随能力不足的问题,利用Gemini-2.5-Flash对25K“人类与Gemini判断一致”样本生成CoT推理文本(如韵律、清晰度分析),微调模型以提升理解与推理能力。

RL阶段(难样本优化):


针对17K“Gemini判断错误”的难样本,采用GRPO强化学习算法,以人类标注为奖励信号(正确+1,错误-1),定向优化模型对复杂案例的判断能力。

3. GRM表现绝对领先


GRM(SFT+RL)准确率达77.2%,投票后提升至79.4%;
较传统模型(如BTRM)高5个百分点,较Gemini-2.5-Flash高8个百分点——首次让机器接近人类对自然度的判断水平。

「应用验证:TTS后训练优化」

两个实验测试GRM实际应用能力,结果遥遥领先:

1. 高质量语音筛选


场景:让Qwen2.5-Omni-7B生成100个语音样本,对比GRM与传统模型(BTRM)选择“最自然样本”的能力。

结论:GRM选中样本“优于随机样本”的比例显著高于BTRM,证明其符合人类偏好。

2. TTS模型后训练优化

对未参与数据构建的Qwen2.5-0.5B-TTS模型(AR+Diffusion架构),测试4种优化方法:
自然度:
GRM在线奖励对齐方法CMOS达0.25±0.09,优于其他方法;
可懂度:
所有方法均高于基线(84.0%),最高达91.0%;
说话人相似度:
无显著下降(“Tie”比例超40%)——实现自然度与相似度的协同优化。

「结论与展望」

总结

本研究核心贡献:
  • 构建99K大规模人类反馈数据集,填补行业空白;
  • 提出SpeechJudge-Eval基准,揭示现有方法缺陷;
  • 创新GRM模型,实现79.4%的自然度判断准确率,可直接用于TTS模型优化。

未来方向

  • 扩展评估维度(如说话人相似度、情感表达准确性);

  • 开发多目标奖励模型,同步优化自然度、可懂度与相似度。