Skip to main content
QUICK REVIEW

[논문 리뷰] Anomalous Sound Detection with Machine Learning: A Systematic Review

Eduardo C. Nunes|arXiv (Cornell University)|2021. 02. 15.
Music and Audio Processing참고 문헌 34인용 수 21
한 줄 요약

이 체계적 리뷰는 2010–2020년 사이 기계 학습을 활용한 비정상 음향 탐지(ASD)에 관한 31篇의 연구를 종합하여 주요 데이터셋, 특징 추출 방법, 머신러닝 모델, 평가 지표를 규명한다. MFCC, 오토에인코더, CNN이 가장 널리 사용된 기법으로 나타나며, AUC와 F1-score가 표준 평가 지표로 사용됨을 확인하여 음향 이상 탐지 분야의 최신 동향을 종합적으로 제공한다.

ABSTRACT

Anomalous sound detection (ASD) is the task of identifying whether the sound emitted from an object is normal or anomalous. In some cases, early detection of this anomaly can prevent several problems. This article presents a Systematic Review (SR) about studies related to Anamolous Sound Detection using Machine Learning (ML) techniques. This SR was conducted through a selection of 31 (accepted studies) studies published in journals and conferences between 2010 and 2020. The state of the art was addressed, collecting data sets, methods for extracting features in audio, ML models, and evaluation methods used for ASD. The results showed that the ToyADMOS, MIMII, and Mivia datasets, the Mel-frequency cepstral coefficients (MFCC) method for extracting features, the Autoencoder (AE) and Convolutional Neural Network (CNN) models of ML, the AUC and F1-score evaluation methods were most cited.

연구 동기 및 목표

  • 2010년부터 2020년까지 비정상 음향 탐지(ASD)를 위한 기계 학습 분야의 현재 최신 기술 수준를 맵핑하기 위해.
  • ASD 연구에서 가장 자주 사용된 데이터셋, 특징 추출 방법, 머신러닝 모델, 평가 지표를 규명하기 위해.
  • 음향 기반 이상 탐지 분야의 향후 연구 및 개발을 안내하기 위해 체계적이고 증거 기반의 개요를 제공하기 위해.
  • 기존 문헌의 추세와 격차를 종합하여 더 효과적이고 표준화된 ASD 시스템 설계를 지원하기 위해.

제안 방법

  • IEEE Xplore, ACM, Scopus, DCASE를 포함한 여러 학술 데이터베이스를 대상으로 PRISMA 지침을 따르는 체계적 문헌 리뷰(SLR)를 수행하였다.
  • 포괄 및 배제 기준 정의: ASD에 기계 학습을 적용한 연구여야 하며, 2010년에서 2020년 사이에 영어로 출판되고, 전문 문서 접근이 가능한 논문이어야 한다.
  • 기계 학습 분류, 이상 탐지 유형(감독, 준감독, 비감독), 데이터셋, 특징 추출 기법, 모델, 평가 지표 등의 데이터를 수집하였다.
  • 관련성과 방법론적 품질을 평가하기 위해 제목, 초록, 전문을 선별한 후 최종적으로 31개의 주요 연구에서 데이터를 추출하고 분석하였다.
  • 일관성과 신뢰성을 확보하기 위해 표준화된 데이터 추출 및 품질 평가 양식을 사용하였다.
  • 주로 데이터셋, 특징 추출, 모델 아키텍처, 평가 성능 기준으로 분류하여 주요 추세를 규명하기 위해 결과를 분류하고 요약하였다.

실험 결과

연구 질문

  • RQ12010년부터 2020년 사이 비정상 음향 탐지 연구에서 가장 흔히 사용된 기계 학습 모델은 무엇인가?
  • RQ2ASD 연구에서 가장 널리 사용되는 음성 특징 추출 방법은 무엇이며, 성능 측면에서 어떻게 비교되는가?
  • RQ3ASD 연구에서 가장 자주 사용되는 데이터셋은 무엇이며, 도메인 및 레이블링 측면에서 특성은 무엇인가?
  • RQ4ASD 연구에서 표준으로 사용되는 평가 지표는 무엇이며, 이는 모델의 일반화 능력과 강건성 반영에 어떻게 기여하는가?
  • RQ5지난 10년간 감독, 준감독, 비감독 학습의 사용은 어떻게 변화해 왔는가?

주요 결과

  • ToyADMOS, MIMII, Mivia 데이터셋이 가장 자주 인용되어 벤치마킹에서의 주요 위치를 차지하고 있음을 확인하였다.
  • 멜 주파수 세프스트럼 계수(MFCC)가 검토된 연구 전반에서 가장 널리 사용된 특징 추출 방법이었다.
  • 오토에인코더(AE)와 컨volutional 신경망(CNN)이 가장 흔히 사용된 머신러닝 모델이었으며, 특히 비감독 및 준감독 환경에서 두드러졌다.
  • 곡선 아래 면적(AUC)과 F1-score가 가장 자주 보고된 평가 지표로 나타나, 모델 성능 평가에서의 중요성을 반영하고 있었다.
  • 대부분의 연구에서 준감독 또는 비감독 학습이 사용되어, 대규모 레이블러된 이상 데이터 확보의 어려움이 드러났다.
  • 특히 산업 및 실제 음향 응용 분야에서 자기지도 학습 및 약한 지도 학습 접근법으로의 전환 경향이 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.