Skip to main content
QUICK REVIEW

[论文解读] Deep Dense and Convolutional Autoencoders for Unsupervised Anomaly Detection in Machine Condition Sounds

Alexandrine Ribeiro, Luís Miguel Matos|arXiv (Cornell University)|Jun 18, 2020
Music and Audio Processing参考文献 14被引用 21
一句话总结

本文提出使用梅尔频谱图特征的深度全连接与卷积自编码器(AE)进行无监督异常检测,用于机器运行声音。仅使用正常声音样本进行训练,模型通过测量重构误差来检测异常,性能表现具有竞争力——尤其在导轨和阀门机器上,卷积自编码器表现更优,各项指标均优于 DCASE 2020 基线模型。

ABSTRACT

This technical report describes two methods that were developed for Task 2 of the DCASE 2020 challenge. The challenge involves an unsupervised learning to detect anomalous sounds, thus only normal machine working condition samples are available during the training process. The two methods involve deep autoencoders, based on dense and convolutional architectures that use melspectogram processed sound features. Experiments were held, using the six machine type datasets of the challenge. Overall, competitive results were achieved by the proposed dense and convolutional AE, outperforming the baseline challenge method.

研究动机与目标

  • 仅使用正常训练数据,解决机器运行声音中的无监督异常检测问题。
  • 开发可在多种机器类型上泛化的深度自编码器模型,无需事先了解异常信息。
  • 通过采用更深的网络结构和梅尔频谱图特征,超越 DCASE 2020 挑战赛基线模型。
  • 使用标准指标,在六种不同机器类型(ToyCar、ToyConveyor、fan、pump、slider、valve)上评估模型性能。
  • 设计混合模型策略,为每类机器选择最佳自编码器,以最大化整体检测性能。

提出的方法

  • 将梅尔频谱图特征作为全连接与卷积自编码器的输入,以实现声音的时频表示。
  • 实现一个深层全连接自编码器,包含四层各 512 个神经元的隐藏层,使用批量归一化、ReLU 激活函数,以及一个 8 个神经元的瓶颈层。
  • 设计一个卷积自编码器,采用步幅卷积与转置卷积,实现频谱图中的分层特征学习。
  • 仅使用正常声音样本训练两个模型,以最小化正常模式的重构误差。
  • 通过计算未见数据的重构误差来检测异常——重构误差越高,越可能为异常。
  • 采用混合模型策略,根据验证性能为每类机器选择表现最佳的自编码器(全连接或 CNN)。

实验结果

研究问题

  • RQ1仅使用正常训练数据,深度全连接与卷积自编码器能否有效检测异常机器声音?
  • RQ2基于梅尔频谱图的自编码器在多种机器类型上的 AUC 与 pAUC 表现,是否优于 DCASE 2020 基线模型?
  • RQ3卷积自编码器是否在捕捉声音频谱图中的时空模式方面优于全连接自编码器?
  • RQ4结合每类机器类型中表现最佳自编码器的混合模型,能否提升整体异常检测性能?
  • RQ5网络深度与归一化(批量归一化)对重构精度与异常检测鲁棒性有何影响?

主要发现

  • 全连接自编码器在六类机器上的平均 AUC(78.77%)与 pAUC(67.58%)均优于 DCASE 2020 基线模型。
  • 卷积自编码器在所有模型中达到最高平均 AUC(80.79%)与 pAUC(71.17%),在五类机器上优于基线模型。
  • 对于导轨机器类型,卷积自编码器达到 AUC 98.86% 与 pAUC 94.47%,表明其具有极强的异常区分能力。
  • 混合模型策略(为每类机器选择最佳自编码器)实现了最强的整体性能,平均 AUC 为 83.45%,pAUC 为 73.50%。
  • 全连接自编码器在 ToyCar(AUC 85.97%)、ToyConveyor(AUC 76.43%)、fan(AUC 72.03%)与 pump(AUC 73.06%)上表现最佳;而卷积自编码器在 slider(AUC 91.77%)与 valve(AUC 78.83%)上表现更优。
  • 表现最佳的模型(slider 上的卷积自编码器)达到 AUC 98.86%,表明其在该机器类型上具备近乎完美的异常检测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。