Skip to main content
QUICK REVIEW

[논문 리뷰] Visually Informed Binaural Audio Generation without Binaural Audios

Xudong Xu, Hang Zhou|arXiv (Cornell University)|2021. 04. 13.
Speech and Audio Processing참고 문헌 47인용 수 4
한 줄 요약

이 논문은 기록된 바이나럴 데이터가 전혀 필요 없이 시각 정보를 활용한 바이나럴 오디오를 생성하는 방법인 PseudoBinaural을 제안한다. 구면 조화 분해와 헤드 관련 인파르스 응답(HRIR)을 활용해 단일 오디오를 바이나럴 출력으로 매핑하고, 해당 소스 방향에 맞게 수동으로 시각적 단서를 배치함으로써 학습을 위한 가짜 시각-스테레오 쌍을 생성한다. 이 방법은 지도 학습 기반 방법과 경쟁 가능한 성능을 달성하며, 실제 바이나럴 데이터와 조합할 경우 최신 기술 수준을 초월하는 성능을 발휘한다.

ABSTRACT

Stereophonic audio, especially binaural audio, plays an essential role in immersive viewing environments. Recent research has explored generating visually guided stereophonic audios supervised by multi-channel audio collections. However, due to the requirement of professional recording devices, existing datasets are limited in scale and variety, which impedes the generalization of supervised methods in real-world scenarios. In this work, we propose PseudoBinaural, an effective pipeline that is free of binaural recordings. The key insight is to carefully build pseudo visual-stereo pairs with mono data for training. Specifically, we leverage spherical harmonic decomposition and head-related impulse response (HRIR) to identify the relationship between spatial locations and received binaural audios. Then in the visual modality, corresponding visual cues of the mono data are manually placed at sound source positions to form the pairs. Compared to fully-supervised paradigms, our binaural-recording-free pipeline shows great stability in cross-dataset evaluation and achieves comparable performance under subjective preference. Moreover, combined with binaural recordings, our method is able to further boost the performance of binaural audio generation under supervised settings.

연구 동기 및 목표

  • 시각 기반 오디오 생성 모델 학습에 있어 바이나럴 오디오 기록의 부족과 높은 비용 문제를 해결하기 위해.
  • 통제된 실내 환경에서의 특정 방에 국한된 데이터셋으로 학습된 지도 학습 모델의 일반화 한계를 극복하기 위해.
  • 단일 오디오와 시각 데이터만을 활용해 바이나럴 오디오 생성을 위한 완전한 비지도 학습 파이프라인을 개발하기 위해.
  • 바이나럴 데이터 없이도 다양한 실제 환경 및 실외 상황에서 안정적이고 일반화된 성능을 달성하기 위해.

제안 방법

  • 단일 오디오-바이나럴 매핑 절차는 단일 오디오의 구면 조화 분해를 통해 공간 오디오 렌더링을 위한 0차 및 1차 성분을 추출한다.
  • 헤드 관련 인파르스 응답(HRIR)을 사용해 분해된 오디오 성분을 임의의 소스 방향에서 바이나럴 출력으로 변환한다.
  • 사전 정의된 시각-좌표 매핑을 통해 소스 방향에 해당하는 특정 구면 좌표에 시각적 단서를 배치한다.
  • 추정된 소스 위치에 시각적으로 배치된 단서와 단일 오디오를 조합하여 가짜 시각-스테레오 쌍을 구성한다.
  • 실제 바이나럴 기록이 필요 없이 합성된 가짜 데이터를 활용해 단일 오디오에서 바이나럴로의 네트워크 학습을 가능하게 한다.
  • 프레임워크는 다양한 수의 소스를 가진 데이터 혼합을 지원하며, 오디오-시각 소스 분리 작업을 학습 보조 과제로 통합한다.

실험 결과

연구 질문

  • RQ1기록된 바이나럴 데이터가 전혀 없이도 단일 오디오와 시각적 단서로부터 바이나럴 오디오를 효과적으로 생성할 수 있는가?
  • RQ2주어진 단일 오디오에 대해 소스 방향과 바이나럴 오디오 출력 사이의 이론적 관계는 무엇인가?
  • RQ3시각적 단서를 체계적으로 공간 위치에 매핑하여 의미 있는 가짜 시각-스테레오 쌍을 형성할 수 있는가?
  • RQ4가짜 데이터가 비지도 및 지도 학습 설정 모두에서 바이나럴 오디오 생성의 일반화 능력과 성능 향상에 기여할 수 있는가?
  • RQ5제안된 바이나럴 복호화 전략이 직접 HRIR 또는 암비오닉스 복호화와 비교할 때 청각적 품질 측면에서 어떻게 다를까?

주요 결과

  • PseudoBinaural은 Mono2Binaural과 같은 지도 학습 기반 방법과 유사한 주관적 성능을 달성했으며, 평가의 54.7%에서 사용자가 더 우수한 스테레오 감각을 선호했다.
  • 경계 아즈임 각도로 π/3를 사용할 경우, STFT 손실은 0.878, SNR은 5.316로, 다른 시각적 시야 구성을 뛰어넘는 성능을 보였다.
  • 사용자 실험 결과, PseudoBinaural은 소스 위치 식별에서 81%의 정확도를 기록했으며, 기준 방법보다 유의미하게 높은 성능을 보였다.
  • 제거 실험을 통해 HRIR과 암비오닉스 복호화를 조합할 경우 가장 우수한 청각적 결과를 얻었으며, 사용자 평가에서 3D 청취 경험 측면에서 가장 높은 점수를 기록했다.
  • 실제 바이나럴 기록과 조합할 경우, PseudoBinaural은 표준 벤치마크에서 성능을 더욱 향상시켜 현재 최고 수준의 기술을 뛰어넘었다.
  • 시각화 분석 결과, PseudoBinaural은 실제 소스 위치에 주의를 기울이는 반면, Mono2Binaural은 천장 등 관련 없는 영역에 주로 주의를 기울이는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.