近日,内蒙古大学计算机学院 语音理解与生成实验室(S2Lab,https://ttslr.github.io/index_S2Group.html)等团队共7篇论文被ICASSP2023接收。论文涉及研究方向包括多模态情感识别、语音增强、长尾物体检测、深度图像哈希、行为检测、动作识别。
下面简要介绍本次录用的各篇论文,并分享论文链接。

01 EXPLOITING MODALITY-INVARIANT FEATURE FOR ROBUST MULTIMODAL EMOTION RECOGNITION WITH MISSING MODALITIES

作者:左昊麟1,刘瑞1*,赵金明2,高光来1,李海洲3

单位:1内蒙古大学,2启元实验室,3香港中文大学(深圳校区)

摘要:多模态情感识别利用跨模态的互补信息实现多模态融合。但是,在实际场景中,模态缺失问题普遍存在。在进行缺失模态预测时,不同模态之间的固有差异(Modality Gap)带来了很大挑战。为了解决这个问题,我们模拟人类的多模态隐含信息推理能力,提出将模态不变特征用于缺失模态想象网络(IF-MMIN),其中包括两种创新机制:1)基于全模态场景下CMD距离的模态不变特征学习策略;2)融合不变特征的缺失模态想象模块(IF-IM),以减轻缺失模态预测期间的Modality Gap问题,从而改善了多模态联合特征表示的鲁棒性。基准数据集IEMOCAP上的实验表明,所提出的模型优于所有基线方法,并且显著改善了不确定缺失模态条件下的整体情感识别性能。

代码网址:

https://github.com/ZhuoYulang/IF-MMIN

论文链接:

https://ieeexplore.ieee.org/abstract/document/10095836

论文解读:论文分享 | 利用模态不变特征在模态缺失条件下实现更鲁棒的多模态情感识别

02 ICCRN: INPLACE CEPSTRAL CONVOLUTIONAL RECURRENT NEURAL NETWORK FOR MONAURAL SPEECH ENHANCEMENT

作者:刘晋江,张学良
单位:内蒙古大学

摘要:根据语音产生的机理,声道将缓慢变化的语义信息调制到声带发出的宽带载波上,这在频谱上分别表现为包络和谐波结构,它们在倒谱域中可以被更稀疏地表示。基于这一机制,我们提出了一种在时频倒谱空间中进行联合降噪的倒谱频率增强模块(CFB)。该方法不使用倒谱作为输入特征,而是隐式的实现频域特征和倒谱空间的相互变换,并在时频域和倒谱空间进行联合增强。最终我们将该CFB模块整合到了我们之前的原地卷积循环网络(ICRN)中,成功的将该模型的适用场景从多通道拓展到了单通道场景。实验结果表明,提出的ICCRN模型显著优于基线系统,并且在谐波结构增强方面具有独特优势。

论文链接:

https://ieeexplore.ieee.org/abstract/document/10096918

03 SPEECH ENHANCEMENT WITH INTELLIGENT NEURAL HOMOMORPHIC SYNTHESIS

作者:何树林1,饶为2,刘晋江1,陈鋆2 , 琚雨恺2 , 张学良1 , 王燕南2 , 商世东2

单位:1内蒙古大学,2腾讯天籁实验室

摘要:大多数基于神经网络的语音增强方法选择直接映射傅里叶变换域频谱或波形,从而忽略语音产生的数学模型,限制了语音增强的性能。在这项工作中,我们提出了一种用于语音增强的神经源-滤波器网络。具体来说,我们使用同态信号处理和倒谱分析来获得带噪语音的激励和声道,与传统信号处理的方法不同,我们使用注意递归网络(ARN)模型预测比率掩码来代替提升分离函数。然后,分别使用两个卷积注意递归网络(CARN)来预测干净语音的激励和声道。系统的输出由估计的激励和声音合成。实验证明,我们提出的方法性能更好,与FullSubNet相比,SI-SNR提高了1.363dB。

论文链接:

https://ieeexplore.ieee.org/abstract/document/10096178

04 CLASS-GUIDED TRIPLE HEAD PREDICTION NETWORK FOR LONG-TAIL OBJECT DETECTION

作者:刘旭阳,郑媛

单位:内蒙古大学

摘要:在现实世界的场景中,数据通常遵循长尾分布。尽管已经出现了大量关于长尾物体检测的工作,但它们仍然存在着对尾部类别判别学习不充分的问题。为了缓解这个问题,我们设计了一个新的类别指导的三头预测网络(CTNet)。考虑到长尾的LVIS数据集包含频繁的、常见的和罕见的类别,我们提出了一个Triple Box Heads(TBH)来处理这三个类别,加强对所有类别的判别性表示。为了训练这样一个TBH,我们采用了一个解耦训练策略,并引入了一个新的通用类特定损失(GCSL),以根据其学习状态进一步适应性地保护稀有类。实验表明,我们的CTHNet不仅优于现有的方法,而且还明显提高了单阶段和双阶段检测器的性能。具体来说,我们的CTHNet在LVIS 0.5上提高了RetinaNet和Faster R-CNN 5.7%和4%的mAPs,特别是对稀有类的APs分别提高了12%和8%。

论文链接:

https://ieeexplore.ieee.org/document/10095289

05 TRANSFORMER-BASED DEEP HASHING METHOD FOR MULTI-SCALE FEATURE FUSION

作者:贺超,魏宏喜

单位:内蒙古大学

摘要:深度图像哈希旨在通过深度神经网络将输入图像映射为简单的二进制哈希码。受视觉Transformer(Vision Transformer, ViT)最新进展的推动,人们提出了许多基于视觉Transformer的深度哈希方法。然而,ViT模型参数数量庞大,计算复杂度高。此外,ViT的最后一层只输出分类令牌作为图像特征向量,而其余的向量被丢弃。这导致模型计算效率低下,并且忽略了有用的图像信息。为此,提出了一种基于Transformer的深度哈希多尺度特征融合(TDH)方法。具体来说,我们使用分层Transformer主干来捕获图像的全局和局部特征。该模型利用局部自关注机制并行处理图像块,降低了计算复杂度,提高了计算效率。多尺度特征融合模块捕获分层Transformer输出的所有图像特征向量,以获得更丰富的图像特征信息。我们在三个广泛研究的数据集上进行了实验:CIFAR-10, NUS-WIDE和IMAGENET。实验结果表明,与现有的先进方法相比,本文提出的方法具有更好的效果。

源代码可用:

https://github.com/shuaichaochao/TDH

论文链接:

https://ieeexplore.ieee.org/abstract/document/10094794

06 YOLOX-B: A BETTER YOLOX MODEL FOR REAL-TIME DRIVER BEHAVIOR DETECTION

作者:郭旭,马明,张佳强,李少杰
单位:内蒙古大学

摘要:在煤炭运输场景中,针对驾驶员行为检测任务提出的目标检测模型普遍存在定位不准确和小目标难以检测的问题,本文提出了一种新的模型YOLOX-B,该模型引入了一种序列化属性空间金字塔池化结构(S-ASPP),通过序列化属性卷积获得不同大小的感受野信息,解决了最大池化中的信息丢失问题。最大限度地提高了卷积的效率。同时,通过引入基于转置卷积的轻量级特征重组模块,自适应预测上采样核权值,使模型能够更好地完成加权像素恢复,提高小目标的检测精度。在公开可用的PASCAL VOC 2012数据集和自建驾驶员行为数据集上的实验结果表明,YOLOX-B与YOLOX-S保持相同的推理速度,平均平均精度(map)分别提高4.4%和0.8%。

论文链接:

https://ieeexplore.ieee.org/abstract/document/10096629

07 MTFD: MULTI-TEACHER FUSION DISTILLATION FOR COMPRESSED VIDEO ACTION RECOGNITION

作者:郭金鑫,张佳强,李少杰,张晓静,马明

单位:内蒙古大学

摘要:作为计算机视觉领域的一项重要工作,近年来一些具有代表性的研究成果,如双流网络、三维卷积网络和基于变压器的网络都取得了优异的成绩。但由于计算成本高,计算时间和参数爆炸式增长,无法满足实时应用的需求。目前的工作是利用压缩视频中保留的关键帧、残差和运动信息进行计算,大大减少了计算量,但仍不能满足实时应用。为此,我们提出了一种多教师融合蒸馏框架用于压缩视频动作识别(MTFD)。与传统的将单个或多个教师的知识直接转移到学生模型的方法不同,我们还进行了教师之间的知识转移。MTFD通过教师之间的相互指导和信息融合实现了更好的知识升华。此外,我们提高了网络提取运动信息的能力,最终在保持高精度的同时减少了计算量。

论文链接:

https://ieeexplore.ieee.org/abstract/document/10097123