Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Audio-Visual Learning Framework for Localization, Separation, and Recognition

Shentong Mo, Pedro Morgado|arXiv (Cornell University)|2023. 05. 30.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 공유 인코더와 작업별 디코더를 사용하여 소리의 원천 위치 특정, 분리, 인식을 동시에 수행하는 통합된 청각시각 학습 프레임워크인 OneAVM을 제안한다. 청각시각 상응성, 혼합된 음성 분리, 그리고 새로운 혼합된 시각 정렬 목적함수를 통합함으로써, OneAVM은 작업별 특화 미세조정 없이도 모든 세 가지 작업에서 최신 기술 수준(SOTA) 성능을 달성하였으며, MUSIC, VGG-Instruments, VGG-Music, VGGSound 데이터셋에서 강력한 작업 간 전이 능력을 입증하였다.

ABSTRACT

The ability to accurately recognize, localize and separate sound sources is fundamental to any audio-visual perception task. Historically, these abilities were tackled separately, with several methods developed independently for each task. However, given the interconnected nature of source localization, separation, and recognition, independent models are likely to yield suboptimal performance as they fail to capture the interdependence between these tasks. To address this problem, we propose a unified audio-visual learning framework (dubbed OneAVM) that integrates audio and visual cues for joint localization, separation, and recognition. OneAVM comprises a shared audio-visual encoder and task-specific decoders trained with three objectives. The first objective aligns audio and visual representations through a localized audio-visual correspondence loss. The second tackles visual source separation using a traditional mix-and-separate framework. Finally, the third objective reinforces visual feature separation and localization by mixing images in pixel space and aligning their representations with those of all corresponding sound sources. Extensive experiments on MUSIC, VGG-Instruments, VGG-Music, and VGGSound datasets demonstrate the effectiveness of OneAVM for all three tasks, audio-visual source localization, separation, and nearest neighbor recognition, and empirically demonstrate a strong positive transfer between them.

연구 동기 및 목표

  • 청각시각 인식에서 작업별 특화 모델의 한계를 해결하기 위해 위치 특정, 분리, 인식을 하나의 프레임워크로 통합하는 것.
  • 청각시각 상응성, 소스 분리, 시각적 특징 분리 최적화를 공동으로 수행함으로써 작업 간 전이 능력을 극대화하는 것.
  • 혼합된 이미지와 개별 음성 소스를 정렬하는 새로운 혼합된 시각 정렬 목적함수를 도입함으로써 소리의 원천 위치 특정 및 분리 성능을 향상시키는 것.
  • 다양한 작업을 동시에 최적화함으로써 일반화 능력과 강인성을 향상시키며, 특히 다수의 소리 소스가 존재하는 복잡한 환경에서의 성능 향상을 입증하는 것.
  • 각 하류 작업에 대한 미세조정 없이도 작업별 기준 모델을 능가하는 단일 통합 모델을 제공하는 것.

제안 방법

  • OneAVM는 영상과 음성 입력으로부터 공동 표현을 추출하기 위해 공유된 이중 스트림 청각시각 인코더를 사용한다.
  • 모델은 프레임 수준에서 음성과 시각적 특징을 정렬하기 위해 국소화된 청각시각 상응성 손실을 적용한다.
  • 음성 스트림에 대해 혼합-분리 목적함수를 적용하여 소스 분리에 대한 구분 능력을 향상시킨다.
  • 새로운 혼합된 시각 정렬(Mixed Visual Alignment, MVA) 목적함수를 도입하여 픽셀 공간에서 이미지를 혼합하고, 그 표현을 모든 해당 음성 소스와 정렬한다.
  • 작업별 디코더는 세 가지 목적함수를 통해 훈련된다: 청각시각 상응성, 음성 분리, MVA를 통한 시각적 특징 분리.
  • 다중 작업 학습을 통해 엔드 투 엔드로 훈련되어 위치 특정, 분리, 인식 간 공동 표현 학습이 가능하다.

실험 결과

연구 질문

  • RQ1통합된 청각시각 모델이 소리의 원천 위치 특정, 분리, 인식을 동시에 최적화하면서 모든 작업에서 성능 향상을 이룰 수 있는가?
  • RQ2혼합된 시각 정렬이 시각적 특징 분리와 위치 특정 정확도에 어떤 영향을 미치는가?
  • RQ3공동 최적화가 특히 위치 특정과 분리 간 작업 간 전이에 어떤 영향을 미치는가?
  • RQ4표준 감독 학습과 비교했을 때, 시각 입력이 혼합된 경우 제안된 MVA 목적함수가 표현 학습에 어떤 영향을 미치는가?
  • RQ5다수의 소리 소스 조건에서 작업별 특화 모델과 비교했을 때, 통합 프레임워크는 성능 및 일반화 능력 측면에서 어떻게 다른가?

주요 결과

  • OneAVM는 시각적 소리 원천 위치 특정에서 최신 기술 수준의 성능을 달성하였으며, VGGSound-All 데이터셋에서 세 개 이상의 소리 소스에 대해 39.68%의 정밀도를 기록하여 CCoL과 EZ-VSL를 능가하였다.
  • 상응성 및 위치 특정 목적함수를 함께 훈련함으로써, 분리 전용 기준 모델 대비 1.53 SDR 및 1.6 SAR 향상된 성능을 기록하였다.
  • 소스 분리의 최적 디코더 깊이는 8이며, 더 깊어질수록 과적합으로 인해 성능 저하가 발생하였다.
  • 혼합된 시각 정렬(MVA) 목적함수에서 혼합 비율 0.5가 모든 평가 지표에서 최고의 위치 특정 성능을 보였다.
  • 기존 기준 모델 대비 소리 소스 수가 증가함에 따라 성능 저하가 더 느리게 나타나 복잡한 환경에서의 강인성을 입증하였다.
  • MUSIC 데이터셋에서 SAR는 MP-Net에 비해 略로 낮지만, 위치 특정 및 인식 성능에서 뛰어난 성능을 보이며 다중 작업 이점이 뚜렷하게 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.