[論文レビュー] Anomalous Sound Detection with Machine Learning: A Systematic Review
この系統的レビューでは、2010年から2020年までの機械学習を用いた異常音検出(ASD)に関する31件の研究を統合し、主要なデータセット、特徴抽出手法、機械学習モデル、評価指標を特定した。MFCC、オートエンコーダー、CNNが最も一般的な手法であり、AUCとF1スコアが標準的な評価指標として用いられていることが判明した。本研究は、音声異常検出分野の研究者に対して包括的かつ最新の状況概要を提供する。
Anomalous sound detection (ASD) is the task of identifying whether the sound emitted from an object is normal or anomalous. In some cases, early detection of this anomaly can prevent several problems. This article presents a Systematic Review (SR) about studies related to Anamolous Sound Detection using Machine Learning (ML) techniques. This SR was conducted through a selection of 31 (accepted studies) studies published in journals and conferences between 2010 and 2020. The state of the art was addressed, collecting data sets, methods for extracting features in audio, ML models, and evaluation methods used for ASD. The results showed that the ToyADMOS, MIMII, and Mivia datasets, the Mel-frequency cepstral coefficients (MFCC) method for extracting features, the Autoencoder (AE) and Convolutional Neural Network (CNN) models of ML, the AUC and F1-score evaluation methods were most cited.
研究の動機と目的
- 2010年から2020年までの機械学習を用いた異常音検出(ASD)分野における現在の最先端技術を把握すること。
- ASD研究において最も頻繁に使用されているデータセット、特徴抽出手法、機械学習モデル、評価指標を特定すること。
- 今後の音声ベースの異常検出分野における研究開発を支援するため、構造的かつ根拠に基づいた概要を提供すること。
- 既存の文献におけるトレンドとギャップを統合することで、より効果的で標準化されたASDシステムの設計を支援すること。
提案手法
- IEEE Xplore、ACM、Scopus、DCASEを含む複数の学術データベースを対象に、PRISMA指針に従った系統的文献レビュー(SLR)を実施した。
- 含む・除外基準を定義した:研究がASDに特化しており、2010年から2020年までの間で英語で発表され、全文アクセスが可能な論文であること。
- 機械学習の分類、異常検出タイプ(教師あり、半教師あり、教師なし)、データセット、特徴抽出技術、モデル、評価指標に関するデータを収集した。
- 題名、要旨、全文のスクリーニングを通じて関連性と方法論的質を評価し、31件の主要研究からデータを抽出・分析した。
- 一貫性と信頼性を確保するため、標準化されたデータ抽出および質の評価フォームを用いた。
- データセット、特徴抽出、モデルアーキテクチャ、評価パフォーマンスごとに分類・要約し、支配的傾向を特定した。
実験結果
リサーチクエスチョン
- RQ12010年から2020年の間、異常音検出研究で最も一般的に使用された機械学習モデルは何か?
- RQ2ASD研究で最も一般的に用いられている音声特徴抽出手法は何か。また、性能面での比較はどのようになるか?
- RQ3ASD研究で最も頻繁に使用されているデータセットは何か。また、分野的特徴やラベル付けの特性は何か?
- RQ4ASD研究で標準的に用いられている評価指標は何か。また、それらはモデルの汎化性と頑健性をどのように反映しているか?
- RQ5過去10年間で、教師あり、半教師あり、教師なし学習の使用はどのように変化したか?
主な発見
- ToyADMOS、MIMII、Miviaのデータセットが、ASD研究で最も頻繁に引用されており、ベンチマークにおいて顕著な存在であることが示された。
- メル周波数ケプストラム係数(MFCC)が、レビュー対象の研究全体で最も広く使用された特徴抽出手法であった。
- オートエンコーダー(AE)と畳み込みニューラルネットワーク(CNN)が、特に教師なしおよび半教師あり設定において最も一般的な機械学習モデルであった。
- 受容的トレーサー曲線下の面積(AUC)とF1スコアが、最も頻繁に報告された評価指標であり、モデルパフォーマンスの評価における重要性を示している。
- 大多数の研究が、半教師ありまたは教師なし学習を採用しており、大規模なラベル付き異常データの入手困難さが顕在化している。
- 特に産業分野や実世界の音声応用において、自己教師ありおよび弱教師ありアプローチへの傾向が顕著に見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。