语音合成 (Text-to-speech, TTS) ,又称文语转换技术,是将文字转换为自然语音的一类技术,是服务于语音交互、信息播报、有声朗读等任务的核心技术。TTS是一个典型的序列到序列(Seq2Seq)任务。然而和机器翻译等NLP中的Seq2Seq任务相比,TTS任务更具挑战,因为它是一个严重的不等长序列映射任务,诸如“hello”这样一个简短的单词就可能对应800个样本点,且人耳听觉对合成语音的音质和自然度具有非常苛刻的要求。为了应对“严重不等长序列映射”的任务,当前的 TTS 框架通常采用两段式结构——由声学模型(acoustic model)和声码器(vocoder)两部分级联构成。声学模型负责从文本序列中预测低分辨率(帧级别)的中间表示,而声码器从中间表示再生成波形采样点。通常情况下这些帧级中间表示是人工设计好的声学参数,例如梅尔谱(mel spectrum),BFCC 等。


西工大音频语音与语言处理研究组(ASLP@NPU)一直致力于提升语音合成的音质,去年提出了基于子带的MelGAN声码器—Multi-band MelGAN[1]。近期,由实验室与腾讯AI LAB合作的论文 "Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis" 被语音研究顶级会议INTERSPEECH2021接收 [2]。在这项工作中,与之前大多数研究中使用预先设计好的声学中间表示(如常用的梅尔谱)不同,论文提出了使用 VAE (Variational Auto-Encoder)结合 GAN(Generative Adversarial Network) 直接从语音中学习中间表示,然后利用基于Flow 的声学模型对潜在中间表示的分布进行建模。实验结果表明,基于Flow的声学模型可以准确地对学习到的语音表示的分布进行建模,并且所提出的 TTS 框架,即 Glow-WaveGAN,合成的音频质量优于主流的利用梅尔谱作为中间表示的模型。现对该论文进行简要的解读和分享。


  • 论文题目:Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis

  • 作者列表:从坚,阳珊,谢磊,苏丹

  • 论文原文:https://arxiv.org/abs/2106.10831


发表论文截图



扫码直接看论文


1. 背景动机

由于文本和语音音频在时间分辨率上的巨大差异,大多数方法将 TTS 过程分为两个阶段,即声学模型和声码器。声学模型首先通过给定的字符或音素序列生成帧级中间表示,而声码器通过中间表示生成音频。尽管最近随着深度学习的应用,声学模型和神经声码器方面取得了较大进展,但是这两个阶段之间仍然存在不匹配(mismatch)现象,这会在推理过程中导致合成语音中的瑕疵。我们认为其中一个重要原因是从声学模型预测的特征和从语音中提取的特征处于不同的分布上。一种直观的减轻不匹配的方法是利用声学模型生成的中间表示去训练或微调(finetune)神经声码器。除此之外,将声学模型和声码器集成到一个“端到端”模型是另一种可能的解决方案 [3,4,5,6],但是这类模型往往在训练中难以快速收敛。

为了解决上述“不匹配”问题,本文提出了Glow-WaveGAN。与现有使用预先设计好的声学特征的方法不同,我们通过变分自动编码器(VAE)直接从语音中学习隐藏表示作为声学模型的预测目标。这里VAE的编码器可以看做是特征提取器,从音频中提取中间表征 Z,VAE的解码器从中间表征 Z 再重建回音频。除此之外,我们在输出上应用生成对抗网络(GAN)去提高重构语音的质量。进一步我们使用基于Flow的声学模型去从文本估计中间表征Z的分布。


2. 提出的方案

图 1 展示了我们所提出的Glow-WaveGAN框架。该架构由 WaveGAN 模块和 Glow-TTS [7] 模块组成,WaveGAN 模块旨在通过波形重构来学习潜在的语音表征,而 Glow-TTS 模块旨在将输入文本映射到由WaveGAN 模块抽取的语音隐层表征。为了学习语音的潜在表征,我们使用了变分自编码器(VAE) 进行特征提取和重建,同时也添加了GAN去提高重建音频的质量。为了提取到更加鲁棒的中间表征Z,我们进一步引入音调(Pitch)预测作为辅助任务。最后,我们利用基于流的声学模型 Glow-TTS 来学习从编码器中提取的潜在表示的分布Z。


图1 Glow-WaveGAN框架


2.1  通过 VAE 提取语音表征以及重构音频

我们使用VAE 以无监督的方式学习语音表征。这里VAE 包含一个编码器和一个解码器,其中编码器将输入的音频w编码为隐特征 z ,解码器从 z 重构回 w:


VAE 的优化目标包括一个重构损失函数和一个先验正则化项。我们采用多分辨率 STFT 损失函数 [8] 来作为重构损失函数。



所提出的用于学习语音表示的 VAE 的详细架构如图 2 所示。编码器包含一堆下采样卷积层,后跟一个残差块,用于总结语音中的抽象信息。在编码过程之后,我们将产生的均值和方差视为学习到的潜在分布 q(z|w) 的统计量。解码器的结构是编码器的镜像对称,我们使用转置卷积来将采样的 z 上采样为语音 。由于基频信息对于自然语音合成很重要,并且 z 将被作为声学模型的目标,我们进一步建议用基频信息来增强潜在表示 z。为了实现这一点,我们引入了一个基频预测器来从z 去预测真实的基频,其帧级基频重建目标为:


其中 p 表示提取的对数基频,f(·) 是具有两个卷积层和线性输出层的预测器,基频提取中的帧移取决于降采样倍数。


图2 本文使用的VAE结构


2.2  通过GAN来重构高质量音频

我们进一步使用 GAN 来改进上述通过VAE重建语音的质量。如图1 所示,将上述带有基频预测器的 VAE 作为生成器,因此生成器首先将波形编码为中间表示 z,然后从 q(z|w) 的采样 z 生成语音。判别器网络对真实音频样本和生成的音频样本进行判决。至于对抗训练,我们使用LSGAN 作为损失函数以稳定训练。GAN 生成器和判别器的损失函数定义为:


其中 G 表示VAE编码和解码部分, D表示多分辨率频谱判别器[9]。此外,我们使用特征匹配损失 (feature matching loss)[9] 作为额外损失来训练生成器。最终,WaveGAN的总损失函数为:



我们在实验中设置 λ1=10,  λ2=1,  λ3=1,  λ4=1,  λ5=20。判别器使用对抗性损失来进行优化。整个训练过程总结在算法 1 中。


算法1 WanGAN的训练流程


值得注意的是,WaveGAN架构如果只结合VAE中的解码器和判别器,并且使用传统梅尔谱作为输入,这个结构就可以被视为基于 GAN 的声码器。我们将这个组合的声码器称为 InnerGAN 并在后续实验中进行对比。


2.3 基于Flow的声学模型

使用包含 VAE 和 GAN 的 WaveGAN,我们可以得到一个用于提取潜在表征的提取器和一个从表征中合成波形的声码器。因此,声学模型旨在对潜在表示 z 的分布进行建模,为了实现这一目标,我们使用基于流的声学模型 Glow-TTS  通过应用可逆变换直接最大化 z 的概率。所以,我们整个TTS的训练流程如下:

  1. 通过音频和提取好的基频训练WaveGAN;

  2. 使用训练好的WaveGAN去提取音频的中间表示Z;

  3. 将提取到的中间表示Z作为Glow-TTS的目标分布训练Glow-TTS。


3. 实验验证

我们分别在英文单人数据LJSpeech以及英文多人数据集VCTK进行了实验,评估本文提出的语音合成方法,同时对比了多个模型:

  • 最先进的基于 GAN 的声码器 HiFi-GAN [10];

  • Inner-GAN 声码器( 结合了VAE 解码器和提到的判别器);

  • Glow-WaveGAN(本文提出的方法)。


3.1 语音合成结果测评

我们在 LJSpeech 和 VCTK 的测试集上进行自然度和音质的 MOS 测试,MOS 得分如表 1 所示。可以看到不管是从真实语音表征生成音频(Copy Synthesis) 或是文本到语音(TTS),提出的 Glow-WaveGAN 得分始终高于其他模型。以及对于Glow-WaveGAN 文本到语音与Copy Synthesis之前的MOS差距仅有0.08,明显低于HiFi-GAN的0.6。这意味着具有更为准确分布的语音表示已经学习到了语音的真实分布,并且对于声学模型,这样学习到的语音表征的分布更容易去预测。和 Inner-GAN 的结果相比,进一步验证了Glow-WaveGAN所带来的MOS增益不是由于模型结构的改变。同时我们发现,pitch预测的重要性,不带pitch预测结构获得MOS得分会明显变差。


表1  在VCTK和LJSpeech上的MOS得分;SR为特征表示,其中带 ^ 的表示声学模型预测。



3.2 对于未见说话人的泛化性

为了衡量本文模型对未见说话人(unseen speaker)的泛化能力,我们使用从 VCTK中预留的9 个随机选择的说话人来进行测试。注意,对于声码器和 WaveGAN 的训练,未见说话人的数据被完全排除在训练集外,但对于训练Glow-TTS,只排除了进行MOS测试的测试集。结果如表 2 所示,可以看到我们提出的模型MOS分优于其他模型,甚至接近于见过的(seen)说话人,表明提出的模型可以很好地推广到未见的说话人。


表2 VTCK上未见说话人的MOS得分;SR为特征表示,其中带 ^ 的表示声学模型预测



3.3 合成样例

LJSpeech TTS 样例

VCTK TTS 样例

-Seen Speaker

-Unseen Speaker

中文 TTS 样例


4. 结论

在这项工作中,我们提出了 Glow-WaveGAN,它可以从文本中合成高保真语音,而无需使用预先设计好的 Mel spectrum作为中间表示。具体来说,我们使用结合了 VAE 和 GAN  的 WaveGAN  的编码器来提取潜在的语音表示,该语音表示可以由解码器重建回波形。为了在声学模型中预测潜在表示的分布,我们利用 Glow-TTS 来从文本估计Z的分布。结果表明,我们提出的模型合成的音频质量优于最先进的利用梅尔谱作为中间表示的模型。


更多样例可访问:

https://syang1993.github.io/glow_wavegan/


参考文献

[1] G. Yang, S. Yang, K. Liu, P. Fang, W. Chen and L. Xie, "Multi-Band Melgan: Faster Waveform Generation For High-Quality Text-To-Speech," 2021 IEEE Spoken Language Technology Workshop (SLT), 2021, pp. 492-498

[2] J. Cong, S. Yang, L. Xie, D. Su., "Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis," Interspeech2021, Brno, Czech Republic, Aug 30 - Sept 3, 2021

[3] Y. Ren, C. Hu, X. Tan, T. Qin, S. Zhao, Z. Zhao, and T.-Y. Liu, "FastSpeech 2: Fast and high-quality end-to-end text to speech," in Proc. of ICLR, 2021.

[4] J. Donahue, S. Dieleman, M. Binkowski, E. Elsen, and K. Simonyan , "End-to-end adversarial text-to-speech," arXiv preprint arXiv:2006.03575, 2020.

[5] R. J. Weiss, R. Skerry-Ryan, E. Battenberg, S. Mariooryad, and D. P. Kingma, "Wave-tacotron: Spectrogram-free end-to-end textto-speech synthesis," in Proc. of ICASSP, 2021, pp. 5679–5683.

[6] C. Miao, S. Liang, Z. Liu, M. Chen, J. Ma, S. Wang, and J. Xiao, "EfficientTTS: An efficient and high-quality text-to-speech architecture," arXiv preprint arXiv:2012.03500, 2020.

[7] J. Kim, S. Kim, J. Kong, and S. Yoon, "Glow-TTS: A generative flow for text-to-speech via monotonic alignment search," in Proc. of NeurIPS, 2020.

[8] R. Yamamoto, E. Song, and J. Kim, "Parallel wavegan: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram," in Proc. of ICASSP, 2020, pp. 6199–6203.

[9] W. Jang, D. Lim, and J. Yoon, "Universal MelGAN: A robust neural vocoder for high-fidelity waveform generation in multiple domains," arXiv preprint arXiv:2011.09631, 2020.

[10] J. Kong, J. Kim, and J. Bae, "Hifi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis," in Proc. of NeurIPS, 2020.