作者ttslr

2022年ISCA国际语音通讯学会年会(2022 Annual Conference of the International Speech Communication Association, INTERSPEECH)发布录用通知,内蒙古大学计算机学院有4篇论文被录用。

这些论文涉及语音合成、回声消除、语音鉴伪、语音增强等多个研究领域,合作伙伴包括:新加坡国立大学(NUS)、新加坡科技与设计大学(SUTD)、英国帝国理工学院(Imperial College London)、香港中文大学(深圳)、中科院自动化所、南方科技大学等。


1 语音情感强度评估(语音合成相关)


内蒙古大学计算机学院语音理解与生成研究组(Speech understanding and Speech generation (S2) Research Group, S2Group(https://ttslr.github.io/index_S2Group.html))刘瑞研究员与新加坡国立大学/香港中文大学(深圳)李海洲教授、英国帝国理工学院Björn Schuller教授、新加坡科技与设计大学Berrak Sisman教授合作,在语音情感强度评估方面的工作被会议录用。
题目:
Accurate Emotion Strength Assessment for Seen and Unseen Speech Based onData-Driven Deep Learning
作者:
Rui Liu(刘瑞), Berrak Sisman, Björn Schuller, Guanglai Gao, Haizhou Li.
合作单位:
新加坡国立大学(NUS)、新加坡科技与设计大学(SUTD)、英国帝国理工学院(Imperial College London)、香港中文大学(深圳)
论文简介:
语音的情感分类和情感强度评估在情感语音合成和语音转换等应用中扮演重要角色。基于支持向量机(SVM)的情感属性排名函数被提出来预测情感语音数据的情感强度。然而,训练后的排名函数不能推广到新领域的情感语音数据,这限制了应用的范围,特别是对于领域外或Unseen的语音。在本文中,我们提出了一个数据驱动的深度学习模型,即StrengthNet,通过融合不同领域的情感数据(下图 Figure.1)来提高对Seen和Unseen的语音的情感强度评估的泛化能力。我们采用多任务学习网络架构(下图 Figure.2),包括一个声学编码器、一个强度预测器和一个辅助情感预测器。实验表明,所提出的强度网络的情绪强度预测与Seen和Unseen的语音的ground truth真实分数高度相关。

我们在以下网址发布了源代码:

https://github.com/ttslr/StrengthNet




2 声学回声消除

内蒙古大学计算机学院张学良教授与声(深圳)科技有限公司合作,在声学回声消除方面的工作被会议录用。
题目:
LCSM: A Lightweight Complex Spectral Mapping Framework for Stereophonic Acoustic Echo Cancellation
作者:
Chenggang Zhang, Jinjiang Liu, Xueliang Zhang.
合作单位:
声科(深圳)科技有限公司
论文简介:
传统的自适应算法在处理立体声回声消除(SAEC)时将面临非唯一性问题。在本文中,我们首先提出了一个基于深度学习的高效多输入多输出(MIMO)方案,以一次性过滤掉所有麦克风信号的回声。然后,我们采用轻量级复杂频谱映射框架(LCSM)来实现端到端的SAEC,而无需对扬声器信号进行去相关预处理。利用就地卷积和信道空间建模来确保近端信号信息得到保留。最后,设计了一个跨域的损失函数,以获得更好的概括能力。在各种未经训练的条件下进行了实验评估,结果表明LCSM明显优于以前的方法。此外,所提出的因果关系框架只有55万个参数,比类似的基于深度学习的方法少得多,这对资源有限的设备很重要。

3 语音鉴伪

内蒙古大学计算机学院张学良教授与中科院自动化所合作,在语音鉴伪方面的工作被会议录用。
题目:
Speaker Recognition-Assisted Robust Audio Deepfake Detection
作者:
Jiahui Pan1*, Shuai Nie2*, Hui Zhang1, Shulin He1, Kanghao Zhang1, Shan Liang2, Xueliang Zhang1, Jianhua Tao2
合作单位:
中科院自动化所
论文简介:
音频深度造假检测通常被表述为对一句语音进行真假语音二元分类。环境线索如背景和设备噪声可以作为分类特征,但它们很容易被攻击,例如简单地在假语音中加入真实的噪声。而语音频谱判别是比较稳健的特征,已经被用于说话人识别模型中,以验证说话人的身份。在这项研究中,我们提出了一个说话人识别辅助的音频深度伪造检测器。由说话人识别模型提取的特征表示被引入到深度伪造检测器的多个层中,以充分利用语音固有的频谱辨别能力。演讲者识别和音频深度伪造检测模型通过多目标学习方法进行联合优化。在ASVspoof 2019年逻辑访问语料库上进行的系统实验表明,所提出的方法优于现有的单一系统,并显著提高了对噪音的鲁棒性。


4 模型压缩(语音增强方面)

内蒙古大学计算机学院张学良教授与南方科技大学合作,在模型压缩方面的工作被会议录用。
题目:
Model Compression by Iterative Pruning with Knowledge Distillation and Its Application to Speech Enhancement
作者:
Zeyuan Wei ,Hao Li , Xueliang Zhang
合作单位:
南方科技大学
论文简介:
在过去的十年中,深度学习已经证明了它的有效性,并不断在各种任务中创造新的记录。然而,良好的模型性能通常会导致大量的参数和极高的计算复杂性,这大大限制了深度学习模型的使用案例,尤其是在嵌入式系统中。因此,模型压缩得到了越来越多的关注。在本文中,我们提出了一种基于迭代修剪和知识提炼的压缩策略。具体来说,在每个迭代中,我们首先利用一个剪枝标准来放弃对性能影响较小的权重。然后,剪枝前的模型被用作教师,对剪枝后的模型进行微调。经过几次迭代后,我们得到了最终的压缩模型。所提出的方法在门控卷积递归网络(GCRN)和长短期记忆(LSTM)的单通道语音增强任务中得到了验证。实验结果表明,所提出的压缩策略可以将GCRN的模型尺寸大幅减少40倍,而不会出现明显的性能下降。