首页
声浪
活动
AI科普
学堂
SOTA
分享
热聘
会员服务
登录
注册
ICASSP 2022 | 基于时频信息融合的工业异音检测
朱晓晓
2022-05-28
阅读 523
转载
ASD
0
0
分享
本文由哈工程智能信号处理组与悉尼科技大学、萨里大学合作,论文一作为2017级本科生柳友德。无监督异常声音检测旨在仅有机器正常声音数据的情况下,实现对机器的未知异常检测。然而,当前方法在异常检测时仍缺乏稳定性,对于同类型的不同设备的异常检测表现呈现出较大差异,部分设备异常检测效果极差,从而导致该类方法缺乏实际应用的可能性。基于此,本文提出了一种基于时频融合的自监督方法,用来学习正常声音信号的特征,以提高异常检测性能和对于个别机器异常检测的稳定性。通过DCASE2020任务2数据的实验表明,所提方法不仅提高了整体异常检测性能,还极大地提升了检测稳定性。相比于当前最好的自监督方法Glow_Aff,所提方法在fan,pump,slider,valve等四类机器上,分别取得了31.79%,17.78%,10.42%和21.13%的mAUC(个别设备的最差表现,稳定性指标)性能提升。
论文地址:
https://arxiv.org/abs/2201.05510
论文代码:
https://github.com/liuyoude/STgram_MFN
背景
异常声音检测(anomalous sound detection, ASD)旨在通过机器的工作声音自动判断设备运行状态是否异常,实现故障检测。在工业生产中,由于异常声音的多样性和异常的偶发性,往往难以获取满足模型训练的异常数据。因此,ASD系统通常采用无监督或自监督策略通过正常数据,学习正常声音的特征分布,实现对设备异音的检测。
无监督ASD系统通常使用自动编码器(autoencoder,AE)对音频特征进行重构,通过最小化重构误差的方式学习正常声音的特征分布,并使用重构误差作为异常分数来判断机器状态,代表性方法如插值深度神经网络(IDNN)。自监督ASD方法则采用描述机器自身属性的元数据信息(例如,机器类型、机器ID等)辅助异音检测,由此获得了优于无监督方法的效果。然而,该类方法往往缺乏异常检测的稳定性,对于同一类型的不同机器个体检测表现仍会呈现较大差异。
虽然基于流的自监督密度估计方法(例如:Glow_Aff),通过使用生成流(generative flow, Glow)或掩蔽自回归流(masked autoregressive flow, MAF)等正则化流,借助分类辅助任务在一定程度上提升了检测稳定性,但对于同类型个别机器的检测仍然缺乏稳定性。此外,基于流的方法需要对每种机器类型的不同机器ID分别建立不同的训练模型,从而制约了该类方法实际应用的可能性。
动机
图1 梅尔谱特征
本文从设备声学特征表示方法入手,对当前异音检测方法所常用的对数梅尔谱特征进行分析。由于该特征是基于人的听觉感知系统设计,其往往会过滤掉人耳无法感知的声音信号的高频部分,从而可能导致异音信号高频部分所蕴含的异常信息缺失,造成检测的不稳定。为此,本文从时频信息互补的角度出发展开研究,并提出了一种基于时频融合的自监督异音检测方法。
方法
本文所提异音检测方法结构如图2所示,采用一个卷积神经网络TgramNet由原始音频提取时域信息。TgramNet由多层1D卷积构成,其中第一层的卷积使用大核卷积替代短时傅里叶变换(Short-Time Fourier Transform, STFT),卷积核的大小和STFT的窗长一致,经过多层卷积后提取出维度与对数梅尔谱(Sgram)一致的时域特征Tgram。随后,将Tgram与Sgram合并融合,由此实现由时域特征对频域对数梅尔谱所滤掉异常信息的补偿,获得更加丰富的异常声音表征与更进一步的异常感知能力。
图2 模型结构
为了验证融合特征的有效性,本文采用MobileFaceNet作为自监督分类器(STgram-MFN),并使用机器ID作为分类的标签。需要注意的是,本文所提出的方法,其模型训练同时面向训练集中所有的机器类型,而非针对每个机器类型分别训练一个模型,更加贴近实际场景检测需求。同时为了进一步减小类内差异并增加类间差异,模型使用ArcFace作为损失函数;并在实验中与交叉熵损失(CEE)进行对比。
实验
对比实验
本文使用DCASE 2020 Task2的开发数据集以及附加数据集进行实验,该数据集中包括了6种不同的机器类型的声音数据。使用ASD任务的评价指标AUC和pAUC来判断模型的整体异常检测效果。
所采用对比方法中,IDNN为基于自编码器重构的无监督声音异常检测方法,MobileNetV2是基于自监督分类的方法,Glow_Aff是结合自监督和标准化流的无监督异常检测方法,STgram-MFN是本文提出的基于时频融合自监督分类异音检测方法。实验结果如表2所示,可以发现所提出的STgram-MFN方法在DCASE2020数据集各个机器类型上都取得了优于现有无监督/自监督ASD方法的整体评价。
此外,本文还将同一机器类型不同机器最小的AUC值(mAUC)作为指标来判断模型的检测稳定性,实验结果如表3所示,可以发现所提出的STgram-MFN方法在mAUC指标上远远优于现有方法,由此表明其能极大提升检测的稳定性。
消融实验
为了表明STgram融合特征对于异常检测稳定性的作用,本文在使用相同分类器情况下,分别使用不同输入特征作为模型输入进行异常检测。实验结果如表4所示。
其中,LogMel-MFN使用对数梅尔谱作为输入特征,Tgram-MFN表示使用Tgram时域特征作为输入,Spec-MFN使用频域声谱(Spectrogram)作为输入特征。由表4可知,时频融合特征STgram在使用CEE损失时,相比于对数梅尔谱的平均mAUC由69.91%提升到76.04%,在使用了ArcFace后更是提升到了84.86%,稳定性大幅提升。而从整体实验结果可以发现,所提出的时频融合策略,相比于单独采用时域或频域特征,可以极大提升异常声音检测的整体性能和稳定性。
为了更进一步说明时域特征和频域特征的互补性,本文给出了LogMel-MFN和Tgram-MFN在Fan机器上的的输出特征的t-SNE图。
图3 LogMel-MFN和Tgram-MFN在Fan机器上的t-SNE图
其中“ID 01”是LogMel-MFN在Fan机器类型中异常检测表现最差的机器,从图3中可以看出正常和异常的特征混淆、难以有效区分;而在Tgram-MFN的输出特征中,则能够被很好地分开。这表明了对数梅尔谱特征不能很好地区分正常和异常声音的特征表示差异,而直接学习到的时域特征Tgram则能够对“ID 01”的正常与异常声音进行很好的区分,进而在融合过程中能够补偿对数梅尔谱中过滤掉的异常信息,从而提升异常检测的稳定性。
结论
本文针对工业异音检测方法缺乏稳定性的问题,从时频特征融合互补的角度出发,提出了一种基于时频融合特征的自监督异音检测方法。通过DCASE2020任务2数据集验证了所提方法的有效性,实验结果表明所提方法能够极大提升自监督异音检测方法的稳定性和检测性能。
评论 0
文明发言,友善讨论
发表评论
还没有评论,发表你的看法,来抢沙发~