语音修复(Speech Restoration)要解决的事很朴素:

把一段“坏掉的语音”修回“听起来像正常录音”的样子。坏的方式很多,比如:

  • 降噪:背景嘶嘶声、风噪、环境噪

  • 去混响:房间回声太大

  • 去削波/爆音(declipping):录音过载导致破音

  • 超分辨率:低码率/窄带语音补回细节

这两年生成式语音修复模型(GenSR:Generative Speech Restoration)确实很猛:即便输入烂得厉害,也能“补出”听感不错的音频。

但它们存在长期硬伤:

1)训练目标 ≠ 人耳偏好

很多生成式修复模型的训练目标更像“把概率分布拟合好/把距离最小化”,而人耳更在乎的是一个组合拳:

  • 听起来自然不自然(有没有金属音、毛刺、机器人感)

  • 干净不干净(噪声残留、奇怪伪影)

  • 内容有没有被改(漏字、吞音、发音歪)

  • 音色/说话人有没有跑(修完变了个人)

结果就是:模型可能在某个指标上很漂亮,但整体听感仍不对劲。

2)只用一个指标做“对齐”,很容易被模型“钻空子”(Reward Hacking)

在生成模型领域很常见:你让模型优化某个分数,它就学会走捷径,把分数刷上去,但其它维度变差。比如:

  • 为了更像原说话人,强行保留音色 → 噪声也一起保留

  • 为了更“干净”,过度抹除细节 → 语音变糊、内容损失

3)语音修复模型形态太多,难做统一后训练

生成式语音修复至少有三大路线:

  • AR(自回归):像语言模型一样按序生成

  • MGM(掩码生成/离散扩散):反复填空修复token

  • FM(Flow-Matching):在连续空间做“从噪声到干净语音”的流动生成

同一套“偏好对齐”方法要想真正落地,必须能跨这三类都有效。


「解决方案」

团队给出的答案是:别指望一个指标代表人耳。要对齐,就用“多指标共同表决”的偏好信号,强行把 reward hacking 的路堵死。

团队提出:Multi-Metric Preference Alignment(多指标偏好对齐)

核心由两步组成:

  1. 构建偏好数据集 GenSR-Pref

  2. 用DPO(Direct Preference Optimization)做后训练对齐


✅核心工作一:GenSR-Pref——80K“偏好对”数据集,赢家必须“四项全优”

很多偏好对齐失败,根因不是算法,而是偏好信号不可信。团队的关键设计是:赢家样本必须同时在四个互补维度都更好,否则不算赢家。

用于“投票”的四个维度(分别管不同听感要素):

  1. 感知音质(Perceptual Quality):NISQA

  2. 信号质量/失真噪声(Signal Fidelity):DNSMOS

  3. 内容一致性(Content Consistency):SpeechBERTScore

  4. 音色/说话人保持(Timbre Preservation):Speaker Similarity

只有当 A 在这四项指标上全部胜过 B,才组成一对偏好样本(A=Chosen,B=Reject)。这相当于“体检四项都合格才算更好”,把“只刷单项分”的捷径直接封死。

数据规模:约 80K 对偏好样本(preference pairs)。并且偏好对的构建主要在同一范式内部做排序(关键)


✅核心工作二:DPO 对齐——不训练奖励模型,直接用“更喜欢谁”微调生成器

每道题都是四选一:

偏好对齐在大模型里常见的是 RLHF,但对音频生成来说成本更高、链路更复杂。我们选了更轻量的路线:DPO(直接偏好优化)。

直观理解:

  • 给定同一个“损坏语音”输入

  • 模型产生多个候选修复结果

  • 我们有一对“赢家/输家”(来自GenSR-Pref)

  • DPO 训练的目标就是:提高赢家的概率、降低输家的概率

另外这套 DPO 还被我们分别适配到了AR / MGM / FM三类生成机制里,做到了“同一思想跨范式落地”。


✅核心工作三:为什么这套方案能稳?我们做了三组“打脸式”消融

我们专门把容易踩坑的地方都验证了一遍:

1)多指标 vs 单指标:多指标明显更稳

单指标对齐确实能把对应分数抬高,但其它指标经常掉(典型 reward hacking)。多指标“一票通过”则能让各项指标一起涨,整体听感更一致。

2)DPO vs 纯监督微调(SFT):DPO 更有效

只拿“好样本”做监督微调(SFT),往往涨一点就停滞;DPO 这种“成对拉开差距”的训练更有力。

更关键的是:我们还发现一种“看起来很合理但会崩”的做法——把 ground-truth(真实干净语音)永远当赢家去做 DPO,会导致模型训练“坍塌”(model collapse)。原因是模型会走极端:为了永远赢,它学会把非GT输出的概率都压得极低,反而不正常。

3)in-paradigm alignment:同范式数据对齐最好

我们提出一个经验法则:AR 用 AR 产生的偏好对来对齐最好,MGM/ FM 同理。

原因很简单:不同生成范式的“错误模式”不一样,改进方向也不一样。用自己的范式数据,更像“顺着自己最擅长的方向纠偏”。

「关键结果:三种生成范式都吃到了收益,而且3K对偏好样本就够用」

我们在多套语音修复基准上测试(包含多任务综合修复GSR、以及下游语音增强DNS基准)。


结论很统一:

  • MGM(AnyEnhance)用大规模偏好对齐(69K对)提升显著,例:在 Librivox-GSR 上 NISQA明显上涨

  • AR(AR+Soundstorm)和FM(Flow-SR)即便只用约 3K 对偏好数据,也能稳定提升多项指标

  • 主观听感 A/B 测试里,人类更偏好对齐后的模型,最高Win rate可到54.5%


一句话总结:不是“换个指标算分”,而是真把生成修复往“人耳更喜欢的方向”推了。

「应用验证:对齐后的生成模型还能当“数据标注员”反哺传统模型」

很多场景(比如歌声修复)缺少成对的“坏音频-干净真值”数据,传统判别式模型(discriminative)就很难训练。

我们做了一个桥接思路:

  • 用对齐后的生成式模型(DPO增强的 AnyEnhance)去生成高质量 pseudo-label(伪标签)

  • 再用这些伪标签去监督训练传统修复模型(Voicefixer)

结果:在真实歌声录音上,Voicefixer 的多项指标都有明显提升。


这说明:对齐后的生成器不仅自己更好用,还能“造数据”帮助数据稀缺任务。

「总结」

团队把“偏好对齐”第一次系统性地落在了生成式语音修复上,解决的核心不是某个新模型结构,而是三个关键工程难题:

  1. 偏好信号怎么定义才靠谱?→ 用“多指标互补 + 全票通过”的严格规则

  2. 怎么避免 reward hacking?→ 从数据构建阶段就把“刷单项分”的路堵死

  3. 能不能跨 AR/MGM/FM 都有效?→ DPO 适配三范式,并验证 in-paradigm alignment 原则