语音增强的目的是从噪声场景中提取有用的语音信号,抑制、降低噪声干扰。在实际场景中,影响语音质量的因素包括拾音距离和遮挡等引起的语音衰减、房间混响、声学回声、噪声和人声干扰等。语音增强的目的或者是给人听,提升主观听感,或是用于辅助后端语音识别等下游任务,提升下游任务的效果 。从采样率的角度看,语音增强任务大致分为分为窄带(8kHz)、宽带(16kHz)、超宽带(24KHz、32kHz)以及全带(48kHz)四个场景,随着频带数目的增加,网络的建模难度也越来越大,目前大部分的工作都是基于宽带场景来做,基于超宽带、全带场景的语音增强任务是一个很重要的挑战。

西工大音频语音与语言处理研究组(ASLP@NPU)近年来致力于基于深度学习的语音增强方向的研究。此前已针对单通道语音增强任务,推出了DCCRN[1]、DCCRN+[2],针对单通道语音增强去混任务,提出了UFormer[3],针对多通道语音增强、分离及去混问题推出了DESNet[4]等模型,基于DCCRN的衍生模型如图1所示。

近期,实验室和腾讯天籁实验室针对单通道超宽带语音增强任务提出了S-DCCRN模型,其相关论文" S-DCCRN: SUPER WIDE BAND DCCRN WITH LEARNABLE COMPLEX FEATURE FOR SPEECH ENHANCEMENT "被语音研究顶级会议ICASSP2022接收。S-DCCRN是基于DCCRN的进一步改进,通过可学习频谱压缩,复数特征编码器、解码器以及级联的子带全带处理,网络可以在较低的频率分辨率下进行超宽带降噪。S-DCCRN在VCTK数据集上指标超越了宽带模型DCCRN以及全带模型PercepNet[5]、RNNoise[6],在Interspeech2021 DNS Challenge盲测集上也获得了优异的效果,现对该论文进行简要的解读和分享。


图1 DCCRN及其衍生模型

论文题目:S-DCCRN: SUPER WIDE BAND DCCRN WITH LEARNABLE COMPLEX FEATURE FOR SPEECH ENHANCEMENT

作者列表:吕术博、付艺辉、邢梦涛、孙佳耀、谢磊、黄俊、王燕南、余涛

论文原文:

https://arxiv.org/pdf/2111.08387.pdf


图2 发表论文截图


图3 扫码直接看论文


01 背景动机

随着远程会议和其他实时语音通信(RTC)场景的快速发展,人们对高质量语音通信的需求急剧增加,已经不能仅仅满足于宽带语音(16KHz)的质量,对超宽带(24KHz、32KHz)甚至全带(48KHz)语音的需求越发迫切。随着采样率的提高,语音包含更丰富、更精细的信息,尤其是在更高的频段。然而,目前大多数基于深度学习的语音增强方法主要集中在采样率为16k Hz的宽带信号上。由于建模更多的频段存在一定的挑战,因此超宽带甚至全频带信号上的语音增强潜力仍有待探索。此外,具有较大维数特征的建模将导致更高的建模复杂度。一些语音增强方法采用Bark谱等压缩特征来建模高频信号,然而特征压缩不可避免地会丢失频带的重要信息,导致性能降低。我们也注意到,Deep Noise Suppression竞赛近期也重点关注全频带语音增强任务。

针对以上的挑战,我们基于此前的DCCRN模型结构,设计了S-DCCRN,即Super Wide-band DCCRN,主要贡献如下:

  • 采用了一组子带和全带结合的DCCRN,首先子带DCCRN精细化学习高低频信息,然后全带DCCRN结合高低频信息,起到平滑衔接作用。

  • 设计了一个可学习频谱压缩的方案,通过网络学习,动态调整不同频带能量。

  • 设计了复数特征编码和解码模块,在同16K降噪模型保持相同的较低频率分辨率的同时,通过复数特征编码从谱上获取更多信息。


02 提出的方案

如图4所示,输入的时域语音首先通过短时傅里叶变换转换到频域,之后频谱特征通过可学习谱压缩模块(Learnable Spectrum Compression, LSC)对能量进行调整,然后在通过一组复数特征编码器(Complex Feature Encoder, CFE)提取频带中的有效信息,提取完后送入子带和全带处理模块(Subband And Fullband processing module, SAF),其中子带DCCRN精细化学习高低频信息,然后全带DCCRN结合高低频信息,起到平滑衔接作用,最后通过复数特征解码器(Complex Feature Decoder, CFD)将降噪后的特征还原回频域。上述三个主要贡献总结在表1中。

表1 S-DCCRN的主要贡献



图4 S-DCCRN 网络结构

Complex Feature Encoder/Decoder

如图5所示,借鉴了DPT-FSNet[7]中的编码器/解码器模块,我们将其拓展到复数域超宽带场景,针对复数特征编码器,首先通过复数卷积提取频域中的高维表征,DenseBlock用来建模时序序列,最后通过卷积核1x1的复数卷积提取局部信息。针对复数特征解码器,首先利用DenseBlock对实虚部进行时序序列建模,之后利用复数Sub-pixel卷积替代反卷积,可以有效避免CheckerBoard现象[9]。最后通过复数卷积还原回频域。


图5 Complex Feature Encoder/Decoder 网络结构

Sub-band & Full-band Processing Module

子带DCCRN的结构如图6所示,我们将DCCRN的复数卷积部分替换成了复数分组卷积,分组数对应着划分的子带数。此外,在Sub-band DCCRN的编码器和解码器之间,我们引入了之前DCCRN+[2]中使用的卷积通路模块,提取编码器的有效信息。全带DCCRN的编码器和解码器采用了复数卷积/反卷积。


图6 Subband-DCCRN 网络结构

Learnable Spectrum Compression

最近,在宽带去噪上压缩率为0.5的频谱压缩表现出了优异的效果[4]。然而,我们认为不同频带的压缩率应该是不同的,因为高频带可能需要较低的压缩系数来保持其高能量。因此,我们引入了一个可学习的频谱压缩模块来压缩STFT频谱。详细来说,可学习的频谱压缩可以描述为:


我们首先初始化一组参数α。然后利用sigmoid函数将其压缩到0~1。最后,我们通过指数运算将不同频带的压缩系数作用到频谱的对应频带。

损失函数

主要由以下三个部分构成,其中KL散度[10]和复数MSE Loss用于衡量增强后的语音和干净语音在复频域的相似性,SISNR Loss[11]用于衡量时域的相似性。


03 实验验证

实验在32KHz的超宽带语音数据上开展。我们首先在Voice Bank + DEMAND数据集[12]上进行消融实验,该数据集的训练集和校验集是固定的,分别是10小时和30分钟。之后S-DCCRN模型进一步地在Interspeech 2021 DNS竞赛数据集[13]上训练,经过筛选,训练数据总共包含了672小时的干净语音和180小时的噪声数据。在Interspeech 2021 DNS竞赛数据集上,训练数据均为动态随机混合生成,信噪比为-5至20dB,测试集是采用Interspeech2021 DNS竞赛官方盲测集。

首先在Voice Bank + DEMAND的测试集上测试各个模型解码结果的PESQ、CSIG、COVL、CBAK以及STOI等指标,如表2所示。从表2中可以看到,SAF模块的性能明显优于 DCCRN,后者在更小的模型尺寸下获得了0.17PESQ的提升。另外,与单独的SAF模块相比,添加CFE/CFD模块会产生更低的PESQ,这个问题可以通过加入频谱压缩模块来解决。最后本文所提出的可学习频谱压缩比传统的频谱压缩更有效,并且对于CFE/CFD模块的收益更大。

表2 Voice Bank + DEMAND测试集结果


如图7所示,我们可视化了网络学习到的频谱压缩系数,可以看到在低于 13k Hz 的频段,频谱压缩率随着频率的增加而逐渐降低。当频率高于13k Hz 时,压缩率先增加,然后稳定在0.5左右。由于低频段具有相对较大的能量,因此不需要较低的压缩系数进行压缩,而高频段能量比较低,因此要求较低的压缩系数来放大能量。此外,13k Hz后压缩系数上升的原因是因为较高频段的信息相对较少,不需要进行深度压缩。


图7 不同频带的频谱压缩系数

为了进一步验证可学习频谱压缩模块的有效性,我们在一个实例上可视化了传统的频谱压缩以及可学习的频谱压缩方案的结果,如图8所示。可以发现,可学习的频谱压缩人声的部分更加清晰,降噪后的噪声残留的更少。


图8 可学习频谱压缩和传统频谱压缩方案结果对比

最后,我们在Interspeech2021 DNS盲测集上测试了各个模型的DNSMOS指标以及主观MOS的分。从表3中可以看到,SAF模块的MOS和DNSMOS与DCCRN处于相同的级别,当再加入CFE/CFD模块和LSC模块时,最终的模型S-DCCRN达到了最高的指标。

表3 Interspeech2021 DNS盲测集结果


04 样例展示
第一组(Musical)
带噪语音:
musical_noisy   音频


DCCRN:

musical_dccrn  音频


S-DCCRN:

musical_sdccrn  音频


第二组(Emotional)

带噪语音:

emotional_noisy  音频


DCCRN:

emotional_dccrn  音频


S-DCCRN:

emotional_sdccrn  音频


第三组(Real Recording)

带噪语音:

realrec_noisy  音频


DCCRN:

realrec_dccrn  音频


S-DCCRN:

realrec_sdccrn  音频


更多样例敬请访问:

https://imybo.github.io/S-DCCRN/

05 参考文献

[1] Yanxin Hu, Yun Liu, Shubo Lv, Mengtao Xing, Shimin Zhang, Yihui Fu, Jian Wu, Bihong Zhang, and Lei Xie, "DCCRN:Deep complex convolution recurrent network for phase-awarespeech enhancement," Interspeech, pp. 2472–2476, 2020.

[2] Shubo Lv, Yanxin Hu, Shimin Zhang, and Lei Xie, "DCCRN+:Channel-wise subband dccrn with snr estimation for speech enhancement," Interspeech2021.

[3] Yihui Fu, Yun Liu, Jingdong Li,Dawei Luo, Shubo Lv, Yukai Jv and Lei Xie, "Uformer: A Unet Based Dilated Complex & Real Dual-path Conformer Network for Simutaneous Speech Enhancement and Dereverberation,"  ICASSP2022

[4] Yihui Fu, Jian Wu, Yanxin Hu, and Lei Xie. "DESNet: A Multi-Channel Network for Simultaneous Speech Dereverberation, Enhancement and Separation," 2021 IEEE Spoken Language Technology Workshop (SLT). IEEE, 2021: 857-864.

[5] Jean-Marc Valin, Umut Isik, Neerad Phansalkar, Ritwik Giri, Karim Helwani, and Arvindh Krishnaswamy.  "A perceptuallymotivated approach for low-complexity, real-time enhancement of fullband speech," Interspeech, pp. 2482–2486, 2020.

[6] Jean-Marc Valin, “A hybrid dsp/deep learning approach to realtime full-band speech enhancement,” in 2018 IEEE 20th international workshop on multimedia signal processing (MMSP). IEEE, 2018, pp. 1–5.

[7] Feng Dang, Hangting Chen, and Pengyuan Zhang, "DPT-FSNet: Dual-path Transformer Based Full-band and Sub-band Fusion Network for Speech Enhancement," arXiv preprint  arXiv:2104.13002, 2021.

[8] Augustus Odena, Vincent Dumoulin, and Chris Olah, "Deconvolution and checkerboard artifacts," Distill, vol. 1, no. 10, pp. e3, 2016.

[9] Andong Li, Chengshi Zheng, Renhua Peng, and Xiaodong Li, “On the importance of power compression and phase estimation in monaural speech dereverberation,” JASA Express Letters, vol. 1, no. 1, pp. 014802, 2021.

[10] Daniel Polani, “Kullback-leibler divergence,” Encyclopedia of Systems Biology, pp. 1087–1088, 2013.

[11]  Yi Luo and Nima Mesgarani, “Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation,” IEEE/ACM transactions on audio, speech, and language processing, vol. 27, no. 8, pp. 1256–1266, 2019.

[12]  Cassia Valentini-Botinhao, Xin Wang, Shinji Takaki, and Junichi Yamagishi, “Investigating RNN-based speech enhancement methods for noise-robust Text-to-Speech.,” in Proc. SSW, 2016, pp. 146–152.

[13]  Chandan KA Reddy, Harishchandra Dubey, Kazuhito Koishida, Arun Nair, Vishak Gopal, Ross Cutler, Sebastian Braun, Hannes Gamper, Robert Aichner, and Sriram Srinivasan, “INTERSPEECH 2021 Deep Noise Suppression Challenge,” Interspeech, pp. 2796–2800, 2021.

06 相关链接

Uformer推介

付艺辉,公众号:语音之家论文推介丨基于Uformer的单通道语音增强及去混

DCCRN+论文推介

术博,公众号:语音杂谈论文推介:语音增强模型DCCRN+—基于SNR估计的子带DCCRN

AEC论文推介

是民,公众号:语音之家声学回声消除:基于多任务学习的残余回声抑制及回声感知代价函数

实验室ICASSP2022发表论文列表

ASLPer,公众号:语音之家NPU-ASLP实验室将携10篇论文参加语音旗舰会议ICASSP2022