近日,ICASSP 2024发布录用通知,哈尔滨工程大学智能信号处理组(Group of Intelligent Signal Processing, GISP)声学场景和事件分类及检测(DCASE)三项研究成果入选,此次也是课题组研究工作连续第5年被ICASSP录用,其中两项异常声音检测(Anomalous Sound Detection, ASD)研究成果被大会接收,一项发表于IEEE SPL期刊的自动音频字幕(Audio Captioning)研究工作入选本次ICASSP会议IEEE信号处理学会(Signal Processing Society, SPS)期刊论文展示。

工业异音检测旨在根据机器设备运行声音自动判断机器运行状态是否异常,以实现机器设备的故障检测及预测性维护,在工业生产领域具有广阔应用前景。近年来,GISP课题组在工业异音检测方向取得一系列研究成果,并在声音识别顶级赛事声学场景和事件分类及检测挑战(Detection and Classification of Acoustic Scenes and Events Challenge, DCASE Challenge)中连续斩获佳绩。本次录用的两篇异音检测成果均从设备属性信息出发,挖掘设备属性信息与运转设备的声学特性之间的联系,通过设备属性信息进行辅助训练及设备声音生成,解决工业异音检测所存在域迁移和异常数据缺失的完全无监督等问题。
以下是两篇异音检测论文简介:


Paper 1:

First-Shot Unsupervised Anomalous Sound Detection with Unknown Anomalies Estimated by Metadata-Assisted Audio Generation

作者:张合静 朱乔茜 关键* 刘濠赫 肖飞扬 田健通 梅昕浩 刘徐博 王文武
论文链接:https://arxiv.org/abs/2310.14173


针对DCASE 2023 Challenge Task2提出的全新任务——First-shot (FS) unsupervised anomalous sound detection (ASD)中目标机器类型的异常声音未被提供的无监督学习问题,本文提出了一个利用元数据辅助生成机器声音来估计未知机器类型的异常从而解决First-Shot无监督异常声音检测任务的新框架,即利用可用的机器信息(即元数据和音频数据)来构建生成模型学习元数据信息与机器声音的联系,借助元数据生成包含未知机器类型的独特声学特征的异常声音,从而解决ASD中的无监督学习问题。为了验证所提框架的有效性,本文所提框架基于TWFR-GMM模型构建了FS-TWFR-GMM方法,FS-TWFR-GMM方法以较少的模型参数在DCASE 2023 Challenge Task2数据集的异常检测阶段取得了优异成绩。此外,本工作也是第一个提出利用设备属性信息生成设备音频进行异常声音检测的工作,为异常声音检测任务提供了新的解决方案。


Paper 2:
Hierarchical Metadata Information Constrained Self-Supervised Learning for Anomalous Sound Detection under Domain Shift

作者:兰海燕 朱乔茜 关键* 魏玉明 王文武

论文链接:https://arxiv.org/abs/2309.07498


自监督学习被广泛应用于解决异常声音检测(ASD)任务中的域迁移问题,常用方法通过在特征学习中结合设备ID来学习特征差异性,以区分正常和异常声音。然而该类处理方法并未考虑导致域迁移问题的属性信息(机器工况和噪声类型等)差异,导致性能受限。为此,本文提出了一种层级约束的自监督学习异常声音检测方法(HMIC),构建了设备ID与属性之间的层级关系,并将其作为约束条件,以实现更精细、更丰富的特征表示。此外,本文还提出了一种基于属性组中心(AGC)的异常分数计算方法,用于计算域偏移条件下的异常分数,以降低属性信息差异的影响。实验表明,本文提出的基于层级约束音频表示方法优于DCASE 2022挑战任务2上最先进方法。


入选SPS期刊展示论文:
Graph Attention for Automated Audio Captioning

作者:肖飞扬 关键* 朱乔茜 王文武

收录期刊:IEEE Signal Processing Letters

论文链接:https://arxiv.org/abs/2304.03586

代码示例链接:https://github.com/LittleFlyingSheep/GraphAC


自动音频字幕是一项跨模态音频内容理解任务,旨在通过自然语言描述音频信号蕴含信息,使机器具备理解表达音频场景事件语意内容的能力。现有的主流自动音频字幕方法几乎均采用大规模音频预训练模型(如:PANNs)进行音频特征表示,借助其音频事件分析能力,提升自动音频字幕性能。但PANNs模型受限于所采用的卷积计算机制,缺乏对音频特征时序上下文关系的建模能力,导致现有主流方法的性能受限。为此,本文提出了一种基于图注意力机制的自动音频字幕方法(GraphAC),所提方法通过构建音频节点邻接图,实现音频信号中的时序上下文信息关系建模,并通过top-k掩码机制过滤与音频场景内容无关信息,由此强化与音频场景事件相关的上下文语意关联,进而提高音频描述的准确性和流畅性。实验结果表明,GraphAC在自动音频字幕任务上获得了优于现有的基于PANNs音频编码器的主流方法的性能表现,由此验证了图注意力机制在捕获音频时序上下文信息的有效性。本文方法所构建集成系统在DCASE 2022 Challenge自动音频字幕赛道(Task 6A)取得了国际第6名。