Skip to main content
QUICK REVIEW

[논문 리뷰] A General Network Architecture for Sound Event Localization and Detection Using Transfer Learning and Recurrent Neural Network

Thi Ngoc Tho Nguyen, Ngoc Khanh Nguyen|arXiv (Cornell University)|2020. 11. 16.
Music and Audio Processing참고 문헌 19인용 수 6
한 줄 요약

이 논문은 다성분 음향 이벤트 현지화 및 탐지(SELD)를 위한 모듈러하고 전이 학습을 지원하는 네트워크 아키텍처를 제안한다. 이는 음향 이벤트 탐지(SED)와 도래 방향(DOA) 추정을 사전 훈련된 하위 네트워크로 분리한 후, 경량 순환 신경망(RNN)을 사용해 출력을 정렬하고 융합한다. 이 방법은 다양한 오디오 포맷과 SED/DOA 알고리즘에서 DCASE 2020 SELD 데이터셋에서 경쟁력 있는 성능를 달성하며, 별도의 모델 최적화와 함께 연합 훈련 복잡도를 감소시켜 더 높은 내구성과 실용성을 입증한다.

ABSTRACT

Polyphonic sound event detection and localization (SELD) task is challenging because it is difficult to jointly optimize sound event detection (SED) and direction-of-arrival (DOA) estimation in the same network. We propose a general network architecture for SELD in which the SELD network comprises sub-networks that are pretrained to solve SED and DOA estimation independently, and a recurrent layer that combines the SED and DOA estimation outputs into SELD outputs. The recurrent layer does the alignment between the sound classes and DOAs of sound events while being unaware of how these outputs are produced by the upstream SED and DOA estimation algorithms. This simple network architecture is compatible with different existing SED and DOA estimation algorithms. It is highly practical since the sub-networks can be improved independently. The experimental results using the DCASE 2020 SELD dataset show that the performances of our proposed network architecture using different SED and DOA estimation algorithms and different audio formats are competitive with other state-of-the-art SELD algorithms. The source code for the proposed SELD network architecture is available at Github.

연구 동기 및 목표

  • 다성분 오디오 환경에서 음향 이벤트 탐지(SED)와 도래 방향(DOA) 추정을 동시에 최적화하는 과제를 해결하기 위해.
  • SED 및 DOA 네트워크의 엔드 투 엔드 연합 훈련에서 복잡성과 과적합 위험을 줄이기 위해.
  • 기존 데이터셋과 모델을 활용해 SED 및 DOA 하위 네트워크의 모듈러 개발과 별도의 향상 가능성을 보장하기 위해.
  • 다양한 SED 및 DOA 알고리즘과 오디오 포맷과 호환되는 일반적이고 실용적인 SELD 아키텍처를 개발하기 위해.
  • 대규모 연합 레이블이 부여된 데이터셋에 대한 의존도를 줄이기 위해 전이 학습과 고수준 특징 정렬을 활용하기 위해.

제안 방법

  • 아키텍처는 두 개의 별도로 사전 훈련된 하위 네트워크를 사용한다: 하나는 SED 전용, 다른 하나는 DOA 추정 전용이며, 각각 자신의 작업 특화 데이터셋으로 훈련된다.
  • SED 하위 네트워크에 대해 AudioSet 사전 훈련 모델의 가중치를 초기화함으로써 전이 학습을 적용한다.
  • RNN 기반 정렬 네트워크는 두 스트림 간의 이벤트 발화 시점, 종료 시점 및 활성 세그먼트를 매칭함으로써 SED 및 DOA 출력을 융합한다.
  • 정렬 네트워크는 시퀀스 수준의 출력에서 작동하며, 상游 처리에 대한 지식 없이 탐지된 음향 클래스를 해당 DOA 추정과 연관시키도록 훈련된다.
  • SED 및 DOA에 대해 다중 레이블 분류 형식을 사용하며, 정렬 네트워크에서 SED 및 DOA의 손실 가중치는 각각 (0.7, 0.3)이다.
  • 시스템은 첫 번째 순서 앤티포닉(FOA) 및 스테레오 마이크 배열(mic-array) 포맷을 사용한 DCASE 2020 SELD 데이터셋에서 평가된다.
Fig. 1 : A general SELD network architecture.
Fig. 1 : A general SELD network architecture.

실험 결과

연구 질문

  • RQ1SED과 DOA 훈련을 분리한 모듈러 네트워크 아키텍처가 엔드 투 엔드 연합 모델과 비교해 경쟁 가능한 SELD 성능를 달성할 수 있는가?
  • RQ2대규모 사전 훈련 모델에서 전이 학습을 통해 제한된 SELD 데이터셋에 대해 미세 조정할 경우 SED 성능가 향상되는가?
  • RQ3아키텍처나 데이터 수준의 결합 없이도, 별도로 훈련된 SED 및 DOA 하위 네트워크의 출력을 효과적으로 융합할 수 있는 RNN 기반 정렬 네트워크가 가능한가?
  • RQ4다양한 오디오 포맷(FoA 대 mic-array)과 SED/DOA 알고리즘 조합에서 제안된 아키텍처의 성능는 어떻게 변하는가?
  • RQ5기존의 작업 특화 데이터셋을 활용해 사전 훈련을 수행함으로써, 대규모 연합 레이블이 부여된 데이터셋이 필요 없이도 프레임워크가 개선될 수 있는가?

주요 결과

  • AudioSet에서 전이 학습을 통해 미세 조정한 SED-T 모델은 FOA 포맷에서 기존의 랜덤 초기화 훈련 대비 F1 점수 2.4%p 향상(80.0%에서 82.1%로)을 기록했다.
  • FOA 포맷에서 SED-T 기반 SELD 모델은 테스트된 모든 모델 중 두 번째로 높은 성능를 기록했으며, 앙상블 기반 SMN 모델에 이어져 간단한 아키텍처로도 뛰어난 성능를 입증했다.
  • mic-array 포맷에서는 SED-T 기반 SELD 모델이 가장 높은 성능를 기록했고, 첫 번째로 랭크되었으며, 이 포맷에 대한 기준 모델이 없어도 성능가 확보되었다.
  • SS 히스토그램 방법을 사용한 DOA 추정 모델(AZI-hist)은 최고의 아즈임 mAP 점수 0.509를 기록했으며, DOA-gcc(0.426) 및 DOA-iv(0.339)를 능가했다.
  • 낮은 독립적 DOA 성능에도 불구하고, DOA-iv 및 DOA-gcc를 사용한 모델는 AZI-hist를 사용한 모델와 유사한 연합 SELD 성능를 기록했으며, 이는 정렬 네트워크가 최적화되지 않은 DOA 추정을 효과적으로 보완함을 시사한다.
  • 제안된 아키텍처는 모든 SED 및 DOA 알고리즘 조합에서 경쟁 가능한 성능를 기록했으며, 이는 모듈러리티와 일반화 능력이 입증됨을 확인한다.
Fig. 2 : Left: Block diagram of the SED and DOAE networks. $n_{frames}$ is the number of input frames. $n_{channels}$ and $n_{features}$ depend on types of input features. Both SED and DOAE are formulated as multi-label multi-class classification. Right: Block diagram of the alignment network. Durin
Fig. 2 : Left: Block diagram of the SED and DOAE networks. $n_{frames}$ is the number of input frames. $n_{channels}$ and $n_{features}$ depend on types of input features. Both SED and DOAE are formulated as multi-label multi-class classification. Right: Block diagram of the alignment network. Durin

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.