该篇论文提出了一种基于大规模预训练模型的鲁棒机器异常声音检测方法,旨在解决由于数据收集困难和复杂声学环境导致的异常声音检测任务泛化性能不佳的问题。研究团队采用wav2vec 2.0、HuBERT、UniSpeech和WavLM等大规模预训练模型,这些模型利用大量未标记语音数据,在自动语音识别任务中取得了显著成果,并在本研究中被应用于提升异常声音检测中的泛化能力。

论文链接:https://ieeexplore.ieee.org/document/10447183


系统框体


图1 基于预训练模型的系统框图:对于波形声音数据,首先采用状态增强技术对其进行增强处理,接着经过增强处理的波形数据会被输入到一个大型预训练模型中,转换为嵌入表示形式,进而进行训练和测试。


主要贡献
  1. 针对异常声音检测任务的特点,设计了一种新的数据增强方法——“状态增强”,通过改变音频信号的速度模拟不同机器运行状态,以增加训练数据的多样性。
  2. 在预训练模型的基础上,不是简单地使用最后一层的输出,而是采用加权求和方式融合来自不同层的隐藏状态,从而整合不同尺度下的声学特征,实验证明这种方法显著提高了检测性能,增强了模型的鲁棒性。

  3. 引入了Transformer池化方法,用于聚集同一录制片段的有效信息,进一步提升了系统的稳定性。


实验结果
表1不同大规模预训练模型在DCASE 2023异常声音检测任务上的结果。其中,“WS”表示来自预训练模型表征的加权求和。“SA”和“TFP”分别代表状态增强和Transformer池化技术。所有结果均采用了DCASE挑战赛中的AUC和pAUC的调和平均数(hmean)作为衡量指标。


结论

实验结果表明,在DCASE2023数据集上的测试中,所提出的模型超越了常见的基于重构的自编码器和基于分类的卷积网络方法,取得较大优势。在DCASE2023挑战赛的Task2中,团队凭借这些策略获得了第二名的成绩,充分证明了大规模预训练对于提高机器异常声音检测的泛化性和鲁棒性的有效作用。此外,论文还展示了预训练模型各层权重分配的可视化结果,揭示了异常信息可能存在于不同层次,多层融合机制有助于捕捉这些信息并优化检测效果。