本次分享ICML 2021会议中一篇语音合成的佳作《Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech》(Authors: Jaehyeon Kim, Jungil Kong, Juhee Son) 。当时号称实现完全端到端建模,合成自然度绝世无双、堪比Ground Truth。
0 Abstract
1 Introduction
2 Method

2.1 Variational Inference
Overview

Reconstruction loss

KL-divergence



2.2 Alignment Estimation
Monotonic alignment search


Duration prediction from text

2.3 Adversarial Training

2.4 Final Loss

2.5 Model Architecture
Posterior encoder
Prior encoder
Decoder
Discriminator
Stochastic duration predictor
3 Experiments
3.1 Datasets
3.2 Preprocessing
3.3 Training
3.4 Experimental Setup for Comparison
4 Results
4.1 Speech synthesis quality
随机时长预测器与确定性时长预测器相比,可以生成更加真实的音素时长; 本文的端到端训练方式与其他TTS模型相比更加有效。

第三行去除了先验编码器中的标准化流,也就是编码器后面没了标准化流增加表达能力,MOS会降低1.52,合成效果下降明显; 第四行后验编码器的输入由线性谱改为梅尔频谱,MOS会降低0.19,说明高分辨率的信息能够提升VITS的表现。

4.2 Generalization to multi-speaker TTS

4.3 Speech variation


4.4 Synthesis speed

5 Conclusion
