Skip to main content
QUICK REVIEW

[论文解读] Anomalous Sound Detection with Machine Learning: A Systematic Review

Eduardo C. Nunes|arXiv (Cornell University)|Feb 15, 2021
Music and Audio Processing参考文献 34被引用 21
一句话总结

本篇系统性综述整合了2010至2020年间关于机器学习在异常声音检测(ASD)中应用的31项研究,识别出关键数据集、特征提取方法、机器学习模型及评估指标。研究发现,MFCC、自编码器(autoencoders)和卷积神经网络(CNNs)是最常用的技术,AUC与F1-score为标准评估指标,为音频异常检测领域的研究人员提供了全面的前沿研究概览。

ABSTRACT

Anomalous sound detection (ASD) is the task of identifying whether the sound emitted from an object is normal or anomalous. In some cases, early detection of this anomaly can prevent several problems. This article presents a Systematic Review (SR) about studies related to Anamolous Sound Detection using Machine Learning (ML) techniques. This SR was conducted through a selection of 31 (accepted studies) studies published in journals and conferences between 2010 and 2020. The state of the art was addressed, collecting data sets, methods for extracting features in audio, ML models, and evaluation methods used for ASD. The results showed that the ToyADMOS, MIMII, and Mivia datasets, the Mel-frequency cepstral coefficients (MFCC) method for extracting features, the Autoencoder (AE) and Convolutional Neural Network (CNN) models of ML, the AUC and F1-score evaluation methods were most cited.

研究动机与目标

  • 映射2010至2020年间机器学习在异常声音检测(ASD)领域的当前研究现状。
  • 识别ASD研究中使用频率最高的数据集、特征提取方法、机器学习模型及评估指标。
  • 提供结构化且基于证据的综述,以指导音频异常检测领域的未来研究与开发。
  • 通过整合现有文献中的趋势与空白,支持设计更高效且标准化的ASD系统。

提出的方法

  • 依据PRISMA指南,在IEEE Xplore、ACM、Scopus及DCASE等多个学术数据库中开展系统性文献综述(SLR)。
  • 定义纳入与排除标准:研究必须聚焦于使用机器学习的ASD,发表于2010至2020年之间,且为英文文献并可获取全文。
  • 收集关于机器学习类别、异常检测类型(监督式、半监督式、无监督式)、数据集、特征提取技术、模型及评估指标的信息。
  • 在筛选标题、摘要及全文以确定相关性与方法学质量后,从31项原始研究中提取并分析数据。
  • 使用标准化的数据提取与质量评估表格,确保研究间的一致性与可靠性。
  • 按数据集、特征提取、模型架构及评估性能对结果进行分类与总结,以识别主导趋势。

实验结果

研究问题

  • RQ1在2010至2020年间,异常声音检测研究中最常使用的机器学习模型有哪些?
  • RQ2在ASD研究中,最普遍的音频特征提取方法有哪些?它们在性能上如何比较?
  • RQ3ASD研究中最常使用的数据集有哪些?其在领域与标注方面的特征是什么?
  • RQ4ASD研究中的标准评估指标有哪些?它们如何反映模型的泛化能力与鲁棒性?
  • RQ5在过去十年中,监督式、半监督式与无监督式学习在ASD中的应用如何演变?

主要发现

  • ToyADMOS、MIMII与Mivia数据集在ASD研究中被引用频率最高,表明其在基准测试中的突出地位。
  • 梅尔频率倒谱系数(MFCCs)是所审查研究中使用最广泛的特征提取方法。
  • 自编码器(AE)与卷积神经网络(CNNs)是最常见的机器学习模型,尤其在无监督与半监督设置中。
  • 曲线下面积(AUC)与F1-score是最常报告的评估指标,反映出其在评估模型性能中的重要性。
  • 多数研究采用半监督或无监督学习,凸显了获取大规模标注异常数据的挑战。
  • 自监督与弱监督方法的应用趋势显著,尤其在工业与真实世界音频应用中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。