Skip to main content
QUICK REVIEW

[논문 리뷰] An Improved Event-Independent Network for Polyphonic Sound Event Localization and Detection

Yin Cao, Turab Iqbal|View|2020. 10. 25.
Music and Audio Processing참고 문헌 29인용 수 8
한 줄 요약

이 논문은 다성분 음향 이벤트 정위 및 탐지(SELD)를 위한 엔드 투 엔드 모델인 이벤트 독립 네트워크 V2(EINV2)를 제안한다. 이 모델은 트랙 기반 출력 형식과 순열 치환 훈련(PIT) 및 다중 헤드 자기주의(MHSA)를 활용하여 동일한 유형의 겹치는 이벤트를 서로 다른 도아(DoA)로 구분하고 트랙 순서 전환 문제를 해결한다. 또한 성능 저하 없이 SED와 DoA 추정을 공동으로 학습할 수 있는 소프트 파rameter 공유 기법을 도입하여 기존 방법을 초월하고 단일 VGG 스타일의 네트워크로 최신 앙상블 모델 수준의 성능을 달성한다.

ABSTRACT

Polyphonic sound event localization and detection (SELD), which jointly performs sound event detection (SED) and direction-of-arrival (DoA) estimation, detects the type and occurrence time of sound events as well as their corresponding DoA angles simultaneously. We study the SELD task from a multi-task learning perspective. Two open problems are addressed in this paper. Firstly, to detect overlapping sound events of the same type but with different DoAs, we propose to use a trackwise output format and solve the accompanying track permutation problem with permutation-invariant training. Multi-head self-attention is further used to separate tracks. Secondly, a previous finding is that, by using hard parameter-sharing, SELD suffers from a performance loss compared with learning the subtasks separately. This is solved by a soft parameter-sharing scheme. We term the proposed method as Event Independent Network V2 (EINV2), which is an improved version of our previously-proposed method and an end-to-end network for SELD. We show that our proposed EINV2 for joint SED and DoA estimation outperforms previous methods by a large margin, and has comparable performance to state-of-the-art ensemble models.

연구 동기 및 목표

  • 동일한 유형이지만 서로 다른 도착 방향(DoA)을 가진 겹치는 음향 이벤트를 구분하지 못하는 기존 방법의 출력 형식 한계를 해결하기 위해, 동일한 유형이지만 서로 다른 도착 방향을 가진 겹치는 이벤트를 탐지하는 데 도전한다.
  • 프레임 수준 및 청크 수준의 순열 치환 훈련(PIT)을 통해 트랙 기반 출력 형식에서 내재된 트랙 순서 전환 문제를 해결한다.
  • SED와 도착 방향(DoA) 추정 간의 공동 학습을 향상시키기 위해 하드 파arameter 공유를 소프트 파arameter 공유 기법으로 대체하여 하위 작업 간 상호 이득을 가능하게 한다.
  • 앙상블 방법이나 복잡한 아키텍처에 의존하지 않고도 최신 기술 수준의 성능을 달성하는 엔드 투 엔드, 이벤트 독립 SELD 모델을 개발한다.

제안 방법

  • 각 트랙이 이벤트 유형, 시작 시간, 종료 시간, DoA를 최대 한 개의 이벤트에 대해 예측하는 트랙 기반 출력 형식을 사용하여 동일한 유형이지만 서로 다른 DoA를 가진 이벤트의 균일한 겹침을 탐지할 수 있도록 한다.
  • 프레임 수준 및 청크 수준의 순열 치환 훈련(PIT)을 적용하여 지도 레이블을 정확한 트랙에 동적으로 할당함으로써 트랙 순서 전환 문제를 해결한다.
  • 다중 헤드 자기주의(MHSA)를 활용하여 트랙 간 잠재 표현을 분리하고 정밀화함으로써 예측 정확도와 내성력을 향상시킨다.
  • 크로스 스티치 모듈을 영감으로 삼은 소프트 파arameter 공유 기법을 도입하여 SED와 DoA 추정 간 공유된 특징 학습을 가능하게 하면서도 작업별 대응 표현 능력을 유지한다.
  • 트랙 기반 출력 형식과 소프트 파arameter 공유를 하나의 엔드 투 엔드 모델에 통합하여 이벤트 독립 네트워크 V2(EINV2)로 명명한다.
  • 일반화 및 성능 향상을 추가로 향상시키기 위해 회전 및 SpecAugment와 같은 데이터 증강 기법을 활용한다.

실험 결과

연구 질문

  • RQ1트랙 기반 출력 형식이 동일한 유형이지만 서로 다른 DoA를 가진 겹치는 음향 이벤트를 이전 출력 형식의 한계를 극복하고 효과적으로 탐지할 수 있는가?
  • RQ2트랙 기반 출력 형식에서 트랙 순서 전환 문제를 훈련 중에 효과적으로 완화할 수 있는가?
  • RQ3SED와 DoA 추정 간 소프트 파arameter 공유가 하드 파arameter 공유 또는 별도 훈련보다 더 나은 공동 성능을 이끌어낼 수 있는가?
  • RQ4간단한 VGG 스타일 아키텍처를 사용하는 단일 엔드 투 엔드 모델이 SELD 과제에서 복잡한 앙상블 모델과 비교해 성능을 낼 수 있는가?

주요 결과

  • 프레임 수준의 PIT를 적용한 트랙 기반 출력 형식(Track_tPIT)은 0.16°의 최저 위치 오차를 기록하여 SELDnet의 5° 높은 오차와 비-PIT 기반 베이스라인(수렴 실패)을 크게 능가한다.
  • EINV2에서의 소프트 파arameter 공유 기법은 하드 파arameter 공유 및 별도 훈련보다 더 뛰어난 성능을 달성하여, 적절히 설계된 경우 상호 이득을 가진 공동 학습이 가능하다는 것을 입증한다.
  • 데이터 증강(회전 및 SpecAugment)을 적용한 EINV2는 단일 모델이면서 기본적인 VGG 스타일 아키텍처를 사용함에도 불구하고 2020년 DCASE 챌린지에서 최고의 앙상블 모델과 비교해 유사한 성능을 달성한다.
  • 제안된 방법은 이전 방법들에 비해 크게 뛰어나며, EINV2의 모든 성능 지표가 별도의 SED 및 DoA 훈련 결과를 넘어서거나 이를 초월함으로써 공동 학습 기법의 효과성을 확인한다.
  • 트랙 기반 출력, PIT, MHSA 및 소프트 파arameter 공유의 조합은 복잡하고 겹치는 상황에서도 균일한 겹침을 정확히 탐지하고 안정적인 DoA 추정을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.