Skip to main content
QUICK REVIEW

[논문 리뷰] CNN depth analysis with different channel inputs for Acoustic Scene Classification

Sergi Perez-Castanos, Javier Naranjo-Alcazar|arXiv (Cornell University)|2019. 06. 10.
Music and Audio Processing참고 문헌 24인용 수 5
한 줄 요약

이 논문은 실시간 엣지 배포를 위한 최적화된 오디오 표현과 앙상블 학습을 사용하는 CNN 기반 음향 환경 분류 시스템을 제안한다. 조화성분과 타악성분을 (L-R) 스테레오 차이와 함께 조합하고 기하 평균 앙상블 집계를 사용할 경우, 개발 세트에서 77.06%의 최고 정확도를 달성하며 단일 모델 및 다른 앙상블 방법을 능가함을 입증한다.

ABSTRACT

Acoustic scene classification (ASC) has been approached in the last years using deep learning techniques such as convolutional neural networks or recurrent neural networks. Many state-of-the-art solutions are based on image classification frameworks and, as such, a 2D representation of the audio signal is considered for training these networks. Finding the most suitable audio representation is still a research area of interest. In this paper, different log-Mel representations and combinations are analyzed. Experiments show that the best results are obtained using the harmonic and percussive components plus the difference between left and right stereo channels, (L-R). On the other hand, it is a common strategy to ensemble different models in order to increase the final accuracy. Even though averaging different model predictions is a common choice, an exhaustive analysis of different ensemble techniques has not been presented in ASC problems. In this paper, geometric and arithmetic mean plus the Ordered Weighted Averaging (OWA) operator are studied as aggregation operators for the output of the different models of the ensemble. Finally, the work carried out in this paper is highly oriented towards real-time implementations. In this context, as the number of applications for audio classification on edge devices is increasing exponentially, we also analyze different network depths and efficient solutions for aggregating ensemble predictions.

연구 동기 및 목표

  • 다양한 오디오 입력 표현 방식이 CNN 기반 음향 환경 분류 정확도에 미치는 영향을 조사하는 것.
  • 다양한 앙상블 기법—산술 평균, 기하 평균, OWA—이 여러 CNN 예측을 융합하는 데서의 효과성을 평가하는 것.
  • 실시간 엣지 배포 환경에서 네트워크 깊이, 추론 속도, 정확도 간의 상호 상충 관계를 분석하는 것.
  • 고정확도, 저지연 음향 환경 분류 시스템을 위한 최적의 오디오 특징과 앙상블 집계 조합을 규명하는 것.
  • 자원 제약이 있는 장치에서 실시간 음향 환경 분류를 위한 실용적이고 효율적인 솔루션을 제공하는 것.

제안 방법

  • 기본 입력 표현으로 40ms 윈도우, 50% 겹침, 헤밍 윈도우, 64밴드 멜 필터 백을 사용한 로그-멜 스펙트로그램을 사용한다.
  • HPSS를 통해 조화성분과 타악성분을 추출하고, (L-R) 스테레오 차이와 함께 다중 채널 입력으로 조합한다.
  • 0.5M에서 1.5M 파라미터까지 다양한 깊이를 가진 세 개의 CNN 아키텍처를 학습 및 평가하여 추론 속도와 정확도 간의 상충 관계를 분석한다.
  • 앙상블 기법으로는 산술 평균, 기하 평균, 및 순서화된 가중 평균(OWA)을 사용하며, 출력 융합에 대해 AND 유사 가중 벡터를 적용한다.
  • 입력 표현을 다양한 구성으로 조합하고 모든 네트워크에서 테스트하여 최적의 입력 조합을 규명한다.
  • 모든 모델은 데이터 증강 없이 DCASE 2019 ASC 챌린지 데이터셋에서 학습 및 평가된다.

실험 결과

연구 질문

  • RQ1모노, 스테레오, 조화성분, 타악성분, 또는 그 조합 중 어떤 오디오 입력 표현 방식이 CNN 기반 음향 환경 분류에서 가장 높은 정확도를 낼 수 있는가?
  • RQ2산술 평균, 기하 평균, OWA와 같은 다양한 앙상블 집계 기법은 성능과 안정성 측면에서 어떻게 비교될 수 있는가?
  • RQ3실시간 엣지 배포 환경에서 CNN의 깊이가 정확도와 추론 시간에 어떤 영향을 미치는가?
  • RQ4HPD와 (L-R)를 조합한 다중 채널 입력을 사용할 경우, 표준 로그-멜 스펙트로그램보다 성능 향상이 이루어지는가?
  • RQ5모델 복잡도나 추론 지연을 증가시키지 않고도 단순한 앙상블 방법이 개별 모델을 능가할 수 있는가?

주요 결과

  • 조화성분과 타악성분을 (L-R) 스테레오 차이와 함께 조합한 HPD 입력 표현이 모든 네트워크에서 가장 높은 정확도를 기록했으며, 모노 및 단일 채널 입력보다 뛰어난 성능을 보였다.
  • 기하 평균 앙상블 집계가 개발 세트에서 가장 뛰어난 성능을 보였으며, 77.06%의 정확도를 달성하여 산술 평균 및 OWA를 능가했다.
  • AND 유사 가중 벡터를 사용한 OWA 역시 성능 향상을 보였으며, 이는 최종 출력에 모든 모델의 고신뢰도 예측이 필요함을 시사한다.
  • 더 깊은 네트워크(1.5M 파라미터)가 더 浅은 네트워크(0.5M 파라미터)를 항상 능가하지는 않았으며, 이는 모델 깊이만으로 정확도 향상이 보장되지 않음을 의미한다.
  • HPD 입력 표현은 가장 높은 정확도(77.06%)를 기록했으며, 이는 기존 문헌에서 제안된 바가 없어 새로운 기여로 간주된다.
  • 기하 평균 앙상블은 '도로 교통' 클래스에서 86.7%의 정확도를 기록하여 모든 클래스 및 방법 중에서 가장 높은 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.