Skip to main content
QUICK REVIEW

[논문 리뷰] Co-Separating Sounds of Visual Objects

Ruohan Gao, Kristen Grauman|arXiv (Cornell University)|2019. 04. 16.
Speech and Audio Processing참고 문헌 49인용 수 10
한 줄 요약

이 논문은 레이블이 없는 자연스러운 다중 소스 비디오에서 음성 임베딩의 일관성을 활용해 깊이 있는 신경망이 객체 수준의 음성 분리를 학습할 수 있도록 하는 공분리 학습 프레임워크를 제안한다. 이 방법은 MUSIC, AudioSet, AV-Bench 데이터셋에서 음성-시각적 소스 분리 및 노이즈 제거 작업에서 최신 기술을 초월하는 성능을 달성하며, 학습 중에 개별적으로 관찰되지 않은 객체들에 대해서도 테스트 비디오에서 음성을 분리할 수 있다.

ABSTRACT

Learning how objects sound from video is challenging, since they often heavily overlap in a single audio channel. Current methods for visually-guided audio source separation sidestep the issue by training with artificially mixed video clips, but this puts unwieldy restrictions on training data collection and may even prevent learning the properties of "true" mixed sounds. We introduce a co-separation training paradigm that permits learning object-level sounds from unlabeled multi-source videos. Our novel training objective requires that the deep neural network's separated audio for similar-looking objects be consistently identifiable, while simultaneously reproducing accurate video-level audio tracks for each source training pair. Our approach disentangles sounds in realistic test videos, even in cases where an object was not observed individually during training. We obtain state-of-the-art results on visually-guided audio source separation and audio denoising for the MUSIC, AudioSet, and AV-Bench datasets.

연구 동기 및 목표

  • 인위적으로 혼합된 오디오 클립에 의존하고 단일 소스 학습 데이터를 전제로 하는 기존의 혼합-분리 학습 프레임워크의 한계를 해결하기 위해.
  • 소리가 자연스럽게 겹치는 실제 세계의 레이블이 없는 다중 소스 비디오에서 객체 수준의 음성 분리를 학습할 수 있도록 하기 위해.
  • 현실적인 오디오 혼합에서 함께 나타나는 소스 간 상관관계를 활용해 일반화 성능을 향상시키기 위해.
  • 학습 중에 개별적으로 관찰되지 않은 객체들에 대해서도 테스트 비디오에서 해당 객체의 소리를 분리할 수 있도록 하기 위해.
  • 비디오 쌍 간에 시각적으로 유사한 객체에 대해 일관된 음성 표현을 강제하는 자기지도 학습 목표를 개발하기 위해.

제안 방법

  • 이 방법은 다수의 소리 소스를 포함한 레이블이 없는 비디오 쌍을 사용하며, 비디오 쌍 내에서 시각적으로 유사한 객체에 대해 일관된 음성 임베딩을 유도하는 공분리 목표를 적용한다.
  • 각 비디오 내에서 객체 감지 결과에 노이즈가 포함된 약한 지도 신호를 활용해 분리된 오디오 트랙을 해당 시각적 객체와 정렬한다.
  • 새로운 손실 함수는 같은 객체 유형(예: 기타)에 대해 분리된 오디오가 다양한 학습 비디오 쌍 간에도 일관되게 식별 가능하도록 보장한다. 이는 배경이나 맥락이 다를 경우에도 성립한다.
  • 이 프레임워크는 비디오 내 분리(한 번의 비디오에서 각 객체의 소리를 식별하는 것)와 비디오 간 일관성(비디오 간 유사한 객체를 매칭하는 것)을 동시에 최적화한다.
  • 깊이 신경망을 활용하며, 분리된 스펙트로그램에서 음성 임베딩을 추출하기 위해 ResNet-18 기반의 오디오 분류기를 사용한다. 이는 시각화 및 후속 작업에 활용된다.
  • 상위 감지된 시각적 객체를 사용해 환경 소음을 분리하는 데 안내함으로써, 시각 기반의 오디오 노이즈 제거를 가능하게 하며, 명시적인 노이즈 모델링 없이도 작동한다.

실험 결과

연구 질문

  • RQ1자신이 개별적으로 기록된 깨끗한 클립이 없는 자연스러운 다중 소스 비디오에서 객체 수준의 소리를 분리할 수 있는 자기지도 학습 방법이 가능한가?
  • RQ2유사한 시각적 객체 간 음성 임베딩의 일관성을 강제할 경우, 기존의 혼합-분리 학습 방식에 비해 분리 성능이 어떻게 향상되는가?
  • RQ3학습 중에 단독으로 관찰되지 않은 객체의 소리를 분리하는 데 모델이 얼마나 잘 일반화되는가?
  • RQ4공분리 목표가 인위적인 혼합 방식에 비해 현실적인 오디오 혼합과 자연스러운 소스 상관관계에 대해 얼마나 더 강건한가?
  • RQ5학습된 음성-시각적 표현은 오디오 노이즈 제거 및 시각적 객체 탐지와 같은 후속 작업에 효과적으로 활용될 수 있는가?

주요 결과

  • 공분리 방법은 MUSIC 데이터셋에서 최신 기술을 초월하는 성능을 달성하며, SDR, SIR, SAR 지표에서 기존 방법을 앞서간다.
  • AudioSet 데이터셋에서, Wooden Horse 비디오의 경우 SDR가 14.5 dB, Violin Yanni의 경우 8.53 dB, Guitar Solo의 경우 11.9 dB로 노이즈 제거 성능을 확보하며, 이는 기존 최고 기술을 뛰어넘는 성과이다.
  • 제로샷 일반화 테스트에서, 학습 중에 단독으로 관찰되지 않은 객체의 소리를 성공적으로 분리함으로써 강력한 일반화 능력을 입증하였다.
  • 음성 임베딩의 t-SNE 시각화 결과, 분리된 소리가 객체 유형별로 군집되어 있음을 확인하여, 모델이 의미적으로 유의미한 음성 표현을 학습하고 있음을 확인하였다.
  • AV-Bench에서 시각적 보조 오디오 노이즈 제거 작업에서 SDR가 14.5 dB를 기록하며, AV-Loc 및 AV-MIML와 같은 기존 방법들을 능가하였다. 이는 노이즈 구조를 명시적으로 모델링하지 않았음에도 불구하고 성취된 성과이다.
  • 제거 실험을 통해 공분리 손실이 성능 향상에 필수적임을 확인하였으며, 일관성 손실를 제거할 경우 성능이 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.