语音转换(Voice Conversion)指在保留语言内容的同时,将源说话人语音转换成目标说话人的语音。由于深度学习强大的非线性建模能力,基于深度学习的语音转换取得了巨大的飞跃。近年来,零资源语音转换受到越来越多的关注。对比传统的GMM [1]、GAN [2]等方法,有如下优点:(1) 测试的源说话人和目标说话人不需要在转换模型训练过程中见过;(2) 只需要一句源说话人和目标说话人的语句就可以实现语音转换,其中源说话人语句提供内容信息,目标说话人语句提供音色信息。然而仅从一句目标说话人的语句中提取的音色信息是不稳定的,从而导致转换后的语音听起来不像是目标说话人发出的。因此更有效的从一句话中提取音色信息有助于提高零资源语音转换的鲁棒性。

语音转换是西工大音频语音与语言处理研究组 (ASLP@NPU)的重要研究方向,在口音和音色解耦[3]、表现力语音转换[4]、低资源语音转换[5]方面发表了多篇论文。近期实验室的论文“Improving robustness of one-shot voice conversion with deep discriminative speaker encoder” 被语音研究顶级会议INTERSPEECH2021 接收。该论文提出一种提取说话人音色的网络结构,通过结合残差网络 (ResNet) [6] 和压缩激励网络(squeeze-and-excitation network) [7] 可以有效的对输入谱特征从帧级和通道级的相互依赖关系进行建模,从而有效提高提取音色的可区分性。现对该论文进行简要解读。
论文题目:Improving robustness of one-shot voice conversion with deep discriminative speaker encoder
作者列表:杜洪强,谢磊
论文Arxiv网址:https://arxiv.org/abs/2106.10406

图1 发表论文截图

图2 扫码直接看论文
零资源语音转换(one-shot voice conversion)模型在测试时,原说话人和目标说话人无需在训练过程中见过,并且只需要原说话人和目标说话人的一句话,因此零资源语音转换技术逐渐成为研究热点。但是,现有的零资源语音转换方法对于未见过的说话人并不稳定,因为从一个未见的说话人的一句话中提取的说话人信息表示是不可靠的。本文提出了一个说话人音色提取网络,以更有效地从一句话中稳定的提取说话人信息。具体地说,首先将残差网络和压缩激励网络相结合,通过对说话人特征的逐帧和逐通道建模以提取帧级别说话人信息。然后引入注意力机制,通过对帧级说话人信息表示赋予不同的权重,进一步强调说话人相关信息。最后利用统计池化层对帧级说话人信息进行加权求和,形成句子级说话人信息表示。实验结果表明,本文提出的说话人信息提取网络可以提高零资源语音转换的语音质量和说话人相似度。
现有的零资源语音转换模型通常包含一个说话人编码器,一个内容编码器,一个解码器。说话人编码器和内容编码器分别提取说话人音色信息和内容信息,解码器重构出谱。测试时,一句源说话人的语句通过内容编码器提取出内容信息,一句目标说话人的语句通过说话人编码器提取出音色信息,解码器预测出转换后的谱。说话人编码器是零资源语音转换模型中一个重要组成部分,能否稳定高效的提取音色信息会显著影响转换后语音的音色。现有的说话人编码器在只给定一句未见说话人语句的情况下,无法稳定的提取音色信息。
如图 3 说话人编码器所示,本文提出的说话人音色信息提取方案主要包括两步:
提取帧级别的说话人信息;
汇总帧级别说话人信息得到句子级别说话人信息。
提取帧级别的说话人信息通过结合残差网络和压缩激励网络实现。引入注意力机制给帧级别信息赋予不同的权重,统计池化实现从帧级别到句子级别的信息汇总。下面详细介绍残差网络、压缩激励网络、注意力网络。

图3 说话人编码器
残差网络:残差网络 (ResNet) 广泛应用于说话人识别 [3] 中,在长句和短句两种测试条件下都取得了良好的性能。基于残差网络的说话人音色提取器包括四个残差模块,一个统计池化层,两层全连接网络。残差模块负责对谱的帧之间的相互依赖关系进行建模,它由卷积网路层,ReLU激活函数,批标准化层组成。残差连接有助于建立一个深度神经网络,增加神经网络的深度可以有效提高网络学习特征的能力。批标准化处理可以提高模型训练过程中的稳定性。然后统计池化层沿着特征的时间轴计算均值和方差以形成句子级别的说话人信息表示。最后两层全连接网络将句子级别的说话人信息压缩为一个固定长度的向量。
压缩激励网络:压缩激励网络 [4] 可以建模特征通道之间的相互依赖关系。它首先应用于图像分类任务中并且提高了分类的准确率。压缩激励网络包括两步:(1) 压缩操作:通过平均池化沿着时间轴对特征求统计参数;(2) 激励操作:以统计参数作为输入,通过神经网络学习各个特征通道的权重。压缩激励网络可以作为一个模块插入到任意卷积神经网络中。我们结合残差网络和压缩激励网络形成ResNet-SE模块,可以有效提高帧级别说话人信息的稳定性。
注意力网络:注意力网络学习各个帧级别信息的权重,统计池化层通过对帧级别信息及对应的权重做加权统计得到句子级别的说话人信息表示。
语料:使用VCTK语料库训练转换模型,CMU和VCC2016语料数据作为测试数据。
系统对比:本文对比了下列方法。
VAE-ORI:原始的AdaIN-VC[8]系统。
VAE-GSE:AdaIN-VC中的说话人编码器替换为工作 [9] 的globel speaker embedding (GSE)。
VAE-ResNet:AdaIN-VC中的说话人编码器替换为基于ResNet的编码器。
VAE-DDSE:AdaIN-VC中的说话人编码器替换为本文提出的deep discriminative speaker encoder (DDSE)。
客观测试:我们用MCD指标比较预测谱和目标谱的差异。根据表 1 可以看到,VAE-DDSE在跨性别转换和同性别转换两方面都明显优于其他系统。这进一步证明说话人编码器对零资源语音转换系统的性能有明显的影响。
表1 不同系统的MCD对比(取值越小越好)

主观测试:主观测试包含三个方面:音质、说话人相似度、自然度,分别采用AB、ABX、MOS打分的方式。10名测试者参加了主观测试。

图4 AB 测试结果
图4是音质AB测试的结果。VAE-DDSE分别和VAE-ORI和VAE-GSE进行了对比,实验结果表明我们提出的说话人提取网络可以提高转换语音的质量。

图5 ABX 测试结果
图5是说话人相似度ABX测试的结果。VAE-DDSE也分别和VAE-ORI和VAE-GSE进行了对比,实验结果表明我们提出的说话人提取网络可以提高转换语音的说话人相似度。

图6 MOS 测试结果
图6是自然度MOS测试的结果。得益于说话人音色信息提取的更加稳定,VAE-DDSE取得了最高的MOS打分。
样例请访问下列网址获取:https://dhqadg.github.io/robust/
[1] T. Toda, A. W. Black, and K. Tokuda, “Voice conversion based on maximum-likelihood estimation of spectral parameter trajectory,” IEEE Transactions on Audio, Speech, and Language Processing, vol. 15, no. 8, pp. 2222–2235, 2007.
[2] T. Kaneko and H. Kameoka, “Parallel-data-free voice conversion using cycle-consistent adversarial networks,” arXiv preprint arXiv:1711.11293, 2017.
[3] Z. Wang, W. Ge, X. Wang, S. Yang, W. Gan, H. Chen, H. Li, L. Xie, and X. Li, “Accent and Speaker Disentanglement in Manyto-many Voice Conversion,” in International Symposium on Chinese Spoken Language Processing (ISCSLP), 2021, pp. 1–5.
[4] Z. Wang, X. Zhou, F. Yang, T. Li, H. Du, L. Xie, W. Gan, H. Chen, H. Li, Enriching Source Style Transfer in Recognition-Synthesis based Non-Parallel Voice Conversion, in Annual Conference of the International Speech Communication Association (Interspeech), 2021.
[5] H. Du, X. Tian, L. Xie, H. Li, Factorized WaveNet for voice conversion with limited data, Speech Communication 130 (2021) 45–54.
[6] N. Li, D. Tuo, D. Su, Z. Li, D. Yu, and A. Tencent, “Deep discriminative embeddings for duration robust speaker verification.” in Annual Conference of the International Speech Communication Association (Interspeech), 2018, pp. 2262–2266.
[7] J. Hu, L. Shen, and G. Sun, “Squeeze-and-excitation networks,” in IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 7132–7141.
[8] J.-C. Chou and H.-Y. Lee, “One-shot voice conversion by separating speaker and content representations with instance normalization,” Annual Conference of the International Speech Communication Association (Interspeech), pp. 664–668, 2019.
[9] H. Lu, Z. Wu, D. Dai, R. Li, S. Kang, J. Jia, and H. Meng, “Oneshot voice conversion with global speaker embeddings.” in Annual Conference of the International Speech Communication Association (Interspeech), 2019, pp. 669–673.
