ICASSP 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2023 录用论文的作者进行报告交流。
ICASSP 2023 论文预讲会邀请到西北工业大学音频语音与语言处理研究组(NPU-ASLP)在5月23日、5月24日分别做两期专场分享,本文介绍第一场相关内容,欢迎大家预约观看。
实验室概况
西北工业大学音频语音与语言处理研究组(ASLP@NPU)依托于空天地海一体化大数据应用技术国家工程实验室和陕西省语音与图像信息处理重点实验室。研究组成立于1995年,经过近20多年的快速发展,已形成了人机语音交互、语音与音频信号处理、音视频多模态信息处理、多媒体内容分析、机器学习等主要研究方向。研究组与比利时、英国、美国、新加坡等多所高校与研究机构建立了长期合作关系,同时,实验室与工业界联系密切,目前已经与华为、腾讯、微软、阿里巴巴、小米、网易、字节跳动、美团、爱奇艺、网易、出门问问等行业头部企业与初创公司开展了广泛深入的科研合作,众多研究成果已经在实际产品中获得应用,获得华为技术合作奖、美团科研合作奖等。实验室在领域顶级期刊和会议上发表学术论文300余篇,在多个重要会议上获得多篇优秀论文奖,参加多个国际国内技术评测获得第一名,取得了丰硕的研究成果。实验室入选2019《互联网周刊》十大顶尖高校人工智能实验室。

宋堃
分享主题:基于数字信号处理做时频域监督的高保真语音合成通用声码器
摘要:基于生成对抗神经网络 (GAN) 的神经声码器的具有诸多优势,如推理速度快、更轻量级的网络等。然而,训练一个基于GAN的通用声码器仍然具有挑战性。通用声码器要求在各种场景中都能合成高保真的语音,包括集外说话人、语种、讲话风格等,这对于鲁棒性有很高要求。本文设计了一种基于 GAN 的通用声码器——DSPGAN,通过应用数字信号处理 (DSP) 的时-频域监督方法来实现高保真语音合成。为了消除由训练阶段的真实频谱和推理阶段的预测频谱间的不匹配问题,利用从 DSP 模块生成的波形中提取梅尔谱作为GAN声码器的时频域监督。同时我们还利用正弦激励信号作为时域监督来改进谐波建模并消除GAN声码器的各种瑕疵。实验结果表明,DSPGAN 明显优于对比方法,并且可以在各种数据训练的 TTS 中的生成高保真语音。
姚继珣
摘要:在影视、有声书内容中,背景音是一种表现丰富的艺术形式。语音转换如能将源说话人语音转换成目标说话人语音的同时,保留源语音中的背景音,将会提供更沉浸的语音转换体验。本文提出了一种基于多任务学习的端到端框架,通过顺序级联源语音的分离模块、瓶颈特征提取模块和语音转换模块,以实现转换后语音保留源语音背景音的功能。语音分离任务明确考虑了关键的相位信息,并有效限制了由不完美分离过程引起的失真。同时,分离任务、典型的语音转换任务和统一任务共享联合训练约束的统一重建损失,以减少分离模块和语音转换模块之间的不匹配。实验表明,该方案在说话人相似度与音质上显著优于基线系统,在保留背景音的同时,能够达到与基于干净数据训练的语音转换模型相当的转换效果。分享主题2:基于共振峰和基频缩放的可区分说话人匿名化摘要:说话人匿名化技术旨在防止个人语音数据受到恶意系统的攻击,并在抑制说话人信息的同时保持语音的可懂度和自然度。在此前VoicePrivacy 2022 挑战赛中,我们提出一种ASV-model free的匿名化框架,能够有效保护说话人的隐私,同时又能保留原始语音的可懂度。尽管该框架在 VoicePrivacy 2022 挑战赛中排名第一,但仍存在匿名化后的语音说话人多样性下降、每个匿名说话人的可区分性变差等问题。为了解决上述问题,本文采用了基于共振峰分布和基频的方法来表示说话人身份,并对其分布进行建模。通过对源语音进行共振峰和基频的统一缩放,可以避免因引入其他说话人信息而导致的匿名语音说话人可区分性下降的问题。实验结果表明,我们提出的框架可以显著提高说话人的可区分性,实现了与最先进方法可比的隐私保护效果。此外,我们还提出了通过使用不同的比例因子来权衡隐私效用的方法。
王智超
分享主题:在基于多因素约束的低资源语音转换中传递源语音说话风格摘要:在语音转换(VC)中,向目标说话人传递语言内容并保持源语音的说话风格(如语调和情感)是非常重要的。然而,在目标说话人语料十分受限的低资源场景中,现有的VC方法很难满足这一要求并捕捉目标说话人的音色信息。本文提出了一种新的VC模型(称之为MFC-StyleVC)用于低资源VC任务。具体来说,我们采用基于聚类的说话人音色约束去监督模型在不同训练阶段对目标说话人音色的学习。同时,在有限的目标说话人数据上,为了防止过拟合导致的模型性能下降,感知正则化约束显式的用于保持模型不同方面的性能,包括说话风格、语义内容和语音质量。此外,我们在训练中引入了一种仿真模式以模拟推理过程,缓解训练和推理之间的不匹配。在高表现力的语音上进行的实验表明,所提出的方法在低资源VC任务上具有良好的性能。宁子谦
分享主题:基于注意力融合瓶颈与扰动特征的高表现力语音转换模型摘要:高表现力语音转换是一个具有挑战性的研究方向。目前方法在说话人相似性、可懂度和表现力之间不得不进行权衡。为了解决这一问题,我们提出了一个结合基于瓶颈特征(BNF)方法和基于信息扰动(Information Perturbation)方法优势相结合的端到端语音转换模型Expressive-VC。具体来说,我们使用一个BNF编码器和一个Perturbed-Wav编码器组成一个内容提取器,分别学习语言学和副语言学特征,其中BNF来自一个鲁棒的预训练ASR模型,而输入音频在信息扰动后移除说话人信息。目标说话人嵌入与源音频中的音高和能量经过韵律编码器提取说话人相关的韵律特征,作为查询向量,通过注意力机制融合语言学和副语言学特征。最后,解码器以融合特征和目标说话人相关韵律特征来生成转换后的语音。实验表明,Expressive-VC优于多个对比系统,既能实现从源语音中捕捉到高表现力,又能实现与目标说话人的高相似度,同时还能很好地保持可懂度。
ICASSP 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾
为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿邮箱
jack@speechhome.com
联系人微信
