标题:《RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS》
链接:https://arxiv.org/pdf/2512.04552
作者单位:阿里通义实验室、北京邮电大学
发表日期:2025年12月4日
摘要:核心问题与框架目标
引言:情感TTS的现状与痛点
监督微调(SFT):用带情感标签的数据集训模型,比如用分类标签或自然语言提示。但缺点很明显——数据集里有啥,模型才能生成啥,超不出数据集的范围,表现力受限。 强化学习(RL):比如DiffRO,它把策略优化做成了全可微分的过程,能让梯度从多任务RM反向传到策略模型(LLM),避免了传统Policy Gradient方法的高方差,效率很高。但DiffRO的致命弱点也在RM上:如果RM本身不鲁棒,策略模型就会钻空子搞“奖励欺骗”——生成那些骗RM给高分、但人类听着很别扭的声音,结果就是RM给的分越高,人类觉得越不自然,完全背离了“情感TTS要好听又有情绪”的目标。
方法:RRPO的核心创新点(重点!)

基础基线:Cosyvoice2(当前主流的LLM-TTS模型)
SFT基线:在目标说话人的情感数据集上微调的LLM
RL基线:DiffRO(就是RRPO要改进的可微分RL框架)
E-MOS:评价情感表达是否准、是否符合指令(1-5分,0.5分一档)
N-MOS:评价语音自然度(比如韵律、发音是否自然,同样1-5分) 测试方式:从测试集(训练时没见过的文本)里随机抽每种情绪10条语音,找20个中文母语者打分。
RM结构跟DiffRO一样,只改了SER任务头的正则化;
超参数:ε=0.1,ε_adv=0.5,α=0.5,学习率1e-5;
训练硬件:8张NVIDIA A800 GPU。


单个组件里EAM效果最猛:比如在ESD上,加了EAM后准确率从64.4飙到82.3——说明解决“决策边界脆”对RM鲁棒性提升最大;
对抗训练(Adv)针对性强:在MER2023(更复杂的中文场景)上,Adv让准确率从52.7升到54.8,但在其他两个数据集上略有下降——这是因为对抗训练本来就有“泛化vs鲁棒”的权衡,它更擅长应对难数据集的扰动;
跨语言泛化牛:RM是用中文数据训的,但在英文数据集IEMOCAP上,RRPO(68.0)比DiffRO基线(66.0)高——说明RM学的是“语言无关的情感本质特征”,不是中文特有的表面声学 cues,鲁棒性实锤。
核心结论:RRPO通过“混合正则化的鲁棒RM”,彻底解决了DiffRO的奖励欺骗问题,让情感TTS的“情感表达”和“自然度”同时提升,而且RM的跨语言、跨场景泛化性很强。 未来能用在哪:
扩展到其他语音属性任务:比如语音质量评估、说话人身份识别,用这套正则化让这些任务的RM也变鲁棒;
融入大规模预训练:用伪标签在预训练阶段就把RM做鲁棒,不用后续微调,提升RL在语音领域的效率和 scalability。
