Skip to main content
QUICK REVIEW

[논문 리뷰] Acoustic Scene Classification Using Fusion of Attentive Convolutional Neural Networks for DCASE2019 Challenge

Hossein Zeinali, Lukáš Burget|arXiv (Cornell University)|2019. 07. 13.
Music and Audio Processing참고 문헌 13인용 수 6
한 줄 요약

이 논문은 DCASE2019 챌린지에서 음향 환경 분류를 위해 VGG-유사, Light-CNN, x-vector의 세 가지 주목적 컨볼루션 신경망을 융합한 방법을 제시한다. 자기 주목적 풀링과 校정된 점수 평균화 또는 다수결정을 통한 모델 앙상블을 활용하여, 공식 검증 폴드에서 평균 정확도 77.0%를 달성하였으며, 기준 모델(62.5%)을 크게 능가하였다.

ABSTRACT

In this report, the Brno University of Technology (BUT) team submissions for Task 1 (Acoustic Scene Classification, ASC) of the DCASE-2019 challenge are described. Also, the analysis of different methods is provided. The proposed approach is a fusion of three different Convolutional Neural Network (CNN) topologies. The first one is a VGG like two-dimensional CNNs. The second one is again a two-dimensional CNN network which uses Max-Feature-Map activation and called Light-CNN (LCNN). The third network is a one-dimensional CNN which mainly used for speaker verification and called x-vector topology. All proposed networks use self-attention mechanism for statistic pooling. As a feature, we use a 256-dimensional log Mel-spectrogram. Our submissions are a fusion of several networks trained on 4-folds generated evaluation setup using different fusion strategies.

연구 동기 및 목표

  • 음향 표현 학습에 적합한 딥 네ural 네트워크를 활용하여 음향 환경 분류 성능을 향상시키기.
  • 변동 길이의 음성 세그먼트와 클래스 불균형 문제를 해결하기 위해 강건하고 주목적 인식 아키텍처를 설계하기.
  • 교차 검증 분할에서 훈련된 다양한 CNN 아키텍처의 모델 융합을 통해 일반화 및 강건성 향상하기.
  • 자기 주목적 풀링이 음향 환경의 주목적 시간 특징을 포착하는 데 평균 풀링보다 얼마나 효과적인지 조사하기.
  • 저자원, 개방 집합 분류 설정에서 다수의 모델을 융합하기 위한 전략—교정된 점수 평균화와 다수결정—평가하기.

제안 방법

  • 256차원 로그 멜 스펙트로그램을 입력 특징으로 사용하였으며, STFT를 통해 2048점 히스팅 윈도우와 430샘플 겹침을 사용하여 단일 채널, 평균 제거된 음성 신호에서 유도하였다.
  • 세 가지 다른 CNN 아키텍처를 훈련: 6개의 잔차 블록을 가진 VGG-유사 2D-CNN, 채널 수를 절반으로 줄이기 위해 최대 특징 맵(МFM) 활성화를 사용하는 Light-CNN, 시간 임베딩 학습을 위한 1D-CNN(x-vector 구조).
  • 풀링 레이어에 자기 주목적 메커니즘을 통합하여 가중 평균과 표준편차를 계산함으로써, 균일한 평균화 대신 정보가 많은 시간 프레임에 동적으로 초점을 맞출 수 있도록 하였다.
  • 과적합을 줄이고 일반화를 향상시키기 위해 훈련 시 512프레임(10초 세그먼트)에서 128프레임의 랜덤 크롭을 사용하였다.
  • 모델 평가 및 훈련을 위한 강건한 방법 확보를 위해 개발 데이터에 4겹 교차 검증 설정을 구현하였으며, 모든 폴드의 출력 기반으로 모델 융합을 수행하였다.
  • 두 가지 전략을 사용하여 모델 융합: (1) FoCal Multiclass 도구를 통한 교정된 점수 평균화(로지스틱 회귀 기반 융합), (2) 예측 클래스에 대한 다수결정 및 융합 점수를 활용한 동점 처리.

실험 결과

연구 질문

  • RQ1자기 주목적 풀링은 기존의 평균 풀링 대비 음향 환경 분류 성능에 어떻게 향상시키는가?
  • RQ2다양한 모델 앙상블에서 VGG-유사, Light-CNN, x-vector 아키텍처의 상대적 기여는 어떠한가?
  • RQ3128프레임의 랜덤 크롭으로 훈련하는 것이 전체 10초 세그먼트 대비 일반화 성능을 향상시키는가?
  • RQ4교정된 점수 평균화와 다수결정은 음향 환경 분류에서 모델 융합에 대해 얼마나 효과적인가?
  • RQ5개발 데이터에 대한 4겹 교차 검증 설정은 공식 검증 폴드보다 더 신뢰할 수 있는 성능 추정을 제공하는가?

주요 결과

  • 공식 DCASE2019 검증 폴드에서 융합 시스템은 평균 정확도 77.0%를 달성하였으며, 기준 시스템(62.5%)을 크게 능가하였다.
  • x-vector 아키텍처는 공원(92.9%)과 도로 교통(90.6%) 환경에서 가장 높은 개별 정확도를 기록하여 고변동성 환경에서 강력한 성능을 보였다.
  • Light-CNN와 VGG-유사 네트워크는 각각 지하철역(75.2%)과 버스(92.7%)에서 뛰어난 성능을 보였으며, 아키텍처 특화의 가능성을 시사하였다.
  • 자기 주목적 풀링은 임계적인 사건이 있는 환경에서 평균 풀링 대비 성능 향상을 이끌었으며, 정보가 많은 프레임에 집중함으로써 효과를 발휘하였다.
  • 교정된 점수 평균화 융합 전략은 특히 동점 예측 상황에서 다수결정을 능가하였으며, 더 나은 점수 교정 덕분이었다.
  • 128프레임 크롭으로 훈련하는 것이 전체 세그먼트 훈련보다 일반화 성능을 향상시켰으며, 과적합 감소와 강건성 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.