Skip to main content
QUICK REVIEW

[논문 리뷰] Relation-guided acoustic scene classification aided with event embeddings

Yuanbo Hou, Bo Soo Kang|arXiv (Cornell University)|2022. 05. 01.
Music and Audio Processing인용 수 5
한 줄 요약

이 논문은 TUT2018 데이터셋에서 허위 레이블이 부여된 음향 이벤트와 학습된 시나리오-이벤트 관계 행렬을 활용하여 음향 시나리오 분류 정확도를 향상시키는 관계 유도 음향 시나리오 분류(RGASC) 모델을 제안한다. 두 타워 CNN을 공동으로 훈련시켜, 시나리오 내 이벤트 발생 빈도에 대한 사전 지식을 활용하여 세분화된 이벤트 신호와 거시적 시나리오 레이블을 융합함으로써, 지하철역에서 17.38%의 정확도 향상과 보행자 도로에서 13.36%의 정확도 향상을 달성한다.

ABSTRACT

In real life, acoustic scenes and audio events are naturally correlated. Humans instinctively rely on fine-grained audio events as well as the overall sound characteristics to distinguish diverse acoustic scenes. Yet, most previous approaches treat acoustic scene classification (ASC) and audio event classification (AEC) as two independent tasks. A few studies on scene and event joint classification either use synthetic audio datasets that hardly match the real world, or simply use the multi-task framework to perform two tasks at the same time. Neither of these two ways makes full use of the implicit and inherent relation between fine-grained events and coarse-grained scenes. To this end, this paper proposes a relation-guided ASC (RGASC) model to further exploit and coordinate the scene-event relation for the mutual benefit of scene and event recognition. The TUT Urban Acoustic Scenes 2018 dataset (TUT2018) is annotated with pseudo labels of events by a simple and efficient audio-related pre-trained model PANN, which is one of the state-of-the-art AEC models. Then, a prior scene-event relation matrix is defined as the average probability of the presence of each event type in each scene class. Finally, the two-tower RGASC model is jointly trained on the real-life dataset TUT2018 for both scene and event classification. The following results are achieved. 1) RGASC effectively coordinates the true information of coarse-grained scenes and the pseudo information of fine-grained events. 2) The event embeddings learned from pseudo labels under the guidance of prior scene-event relations help reduce the confusion between similar acoustic scenes. 3) Compared with other (non-ensemble) methods, RGASC improves the scene classification accuracy on the real-life dataset.

연구 동기 및 목표

  • 음향 시나리오와 이벤트 레이블이 모두 포함된 실제 세계 데이터셋의 부족을 해결한다.
  • 음향 시나리오 분류와 이벤트 분류를 독립적인 과제로 간주하는 한계를 극복한다.
  • 실제 세계에서의 시나리오와 이벤트 간의 암묵적인 관계를 활용하여 분류 성능을 향상시킨다.
  • 검증되지 않은 허위 레이블이 시나리오-이벤트 관계에 의해 유도될 경우, 이벤트 정보가 시나리오 분류에 기여할 수 있음을 입증한다.
  • 시나리오와 이벤트 인식 간 双방향 지식 전이를 가능하게 하는 공동 학습 프레임워크를 개발한다.

제안 방법

  • TUT2018 데이터셋에서 527개의 음향 이벤트 클래스에 대해 사전 학습된 PANN 모델을 사용해 허위 레이블을 생성한다.
  • 각 시나리오 클래스당 평균 이벤트 확률로 구성된 사전 시나리오-이벤트 관계 행렬 $ R_{SE} $ 를 구축한다.
  • 공유된 특징 추출기와 $ R_{SE} $ 를 기반으로 한 교차 주의 메커니즘을 갖춘 두 타워 CNN 아키텍처를 설계한다.
  • 시나리오 및 이벤트 분류를 위한 다중 과제 학습을 통해 모델을 엔드 투 엔드로 훈련시킨다.
  • 임베딩 공간의 군집화와 혼동 감소를 분석하기 위해 t-SNE 시각화를 적용한다.
  • PANN을 교사 모델로, AEC 타워를 학생 모델로 간주하여 지식 정복 원리를 적용해 이벤트 표현 지식을 전이한다.

실험 결과

연구 질문

  • RQ1실제 세계의 시나리오-이벤트 관계에 의해 유도될 경우, 허위 레이블이 부여된 음향 이벤트가 음향 시나리오 분류 성능을 향상시킬 수 있는가?
  • RQ2학습된 시나리오-이벤트 관계 행렬을 통합할 경우, 유사한 음향 시나리오의 구분 능력은 어떻게 영향을 받는가?
  • RQ3검증되지 않은 허위 레이블이 여전히 시나리오 분류 성능 향상에 기여할 수 있는 정도는 어느 정도인가?
  • RQ4관계 유도 융합을 갖춘 두 타워 모델이 기존의 다중 과제 학습 또는 단일 과제 기반 베이스라인을 초월할 수 있는가?
  • RQ5관계 유도 융합이 버스와 트램, 또는 교통과 공원과 같이 음향적으로 유사한 시나리오 간의 혼동을 줄이는가?

주요 결과

  • RGASC는 기준 모델 puASC 대비 지하철역 클래스에서 17.38% 향상된 정확도를 달성했고, 보행자 도로 클래스에서는 13.36% 향상되었다.
  • 모델은 교통 클래스에서 90.24%의 정확도를 기록했고, 공항 클래스에서는 86.42%의 정확도를 달성하여 기준 모델 puASC를 초월했다.
  • t-SNE 시각화 결과, RGASC의 임베딩 공간에서 유사한 시나리오(예: 버스/트램, 광장/공원)의 군집화가 더 명확하게 나타나 혼동 감소를 시사한다.
  • 허위 레이블이 정답 레이블이 아니더라도, 시나리오-이벤트 관계 행렬이 허위 레이블 기반 이벤트 정보 융합을 효과적으로 유도한다.
  • AEC 타워는 허위 레이블에서 의미 있는 이벤트 표현을 학습하며, 이는 시나리오 분류기가 유사한 시나리오를 더 잘 구분할 수 있도록 한다.
  • 사전 학습된 모델(PANN)에서 학생 AEC 타워로의 지식 정복이 시나리오-이벤트 관계에 의해 유도될 경우, 시나리오 분류 성능 향상이 달성됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.