Skip to main content
QUICK REVIEW

[論文レビュー] Visually Informed Binaural Audio Generation without Binaural Audios

Xudong Xu, Hang Zhou|arXiv (Cornell University)|Apr 13, 2021
Speech and Audio Processing参考文献 47被引用数 4
ひとこと要約

この論文では、録音されたバイナリオ音声データを一切必要とせず、視覚的情報を用いてバイナリオ音声を生成する手法PseudoBinauralを提案する。球面調和関数分解と頭部伝達インパルス応答(HRIR)を活用してモノラル音声をバイナリオ出力にマッピングし、視覚的ヒントを対応する音源方向に手動で配置することで、学習用の擬似視覚ステレオペアを構築する。本手法は教師あり手法と同等の性能を達成し、実際のバイナリオデータと組み合わせることで最先端の結果をさらに向上させる。

ABSTRACT

Stereophonic audio, especially binaural audio, plays an essential role in immersive viewing environments. Recent research has explored generating visually guided stereophonic audios supervised by multi-channel audio collections. However, due to the requirement of professional recording devices, existing datasets are limited in scale and variety, which impedes the generalization of supervised methods in real-world scenarios. In this work, we propose PseudoBinaural, an effective pipeline that is free of binaural recordings. The key insight is to carefully build pseudo visual-stereo pairs with mono data for training. Specifically, we leverage spherical harmonic decomposition and head-related impulse response (HRIR) to identify the relationship between spatial locations and received binaural audios. Then in the visual modality, corresponding visual cues of the mono data are manually placed at sound source positions to form the pairs. Compared to fully-supervised paradigms, our binaural-recording-free pipeline shows great stability in cross-dataset evaluation and achieves comparable performance under subjective preference. Moreover, combined with binaural recordings, our method is able to further boost the performance of binaural audio generation under supervised settings.

研究の動機と目的

  • 視覚的情報を用いた音声生成モデルの学習におけるバイナリオ音声録音の不足と高コスト問題に対処すること。
  • 制御された部屋固有のデータセットで学習された教師ありモデルの一般化性能の限界を克服すること。
  • モノラル音声と視覚的情報のみを活用して完全に教師なしのパイプラインを構築すること。
  • バイナリオデータが存在しない状況でも、多様な現実世界および非制御環境において安定的かつ一般化可能な性能を実現すること。

提案手法

  • モノラル音声の球面調和関数分解を用いたモノラル・バイナリオ変換手順により、空間音声レンダリング用のゼロ次および一次成分を抽出する。
  • 頭部伝達インパルス応答(HRIR)を用いて、分解された音声成分を任意の音源方向のバイナリオ出力に変換する。
  • 事前に定義された視覚座標マッピングを用いて、音源方向に対応する球面座標に視覚的ヒントを配置する。
  • 推定された音源位置に視覚的に配置されたヒントとモノラル音声を組み合わせることで、擬似視覚ステレオペアを構築する。
  • 本手法により、実際のバイナリオ録音を必要とせず、合成された擬似データ上でモノラルからバイナリオへのネットワークの学習が可能になる。
  • フレームワークは、音源数の異なるデータ混合をサポートし、音声と視覚の分離を学習の補助タスクとして統合する。

実験結果

リサーチクエスチョン

  • RQ1録音されたバイナリオデータが一切ない状況でも、モノラル音声と視覚的ヒントから効果的にバイナリオ音声を生成できるか?
  • RQ2与えられたモノラル音声に対して、音源方向とバイナリオ音声出力との間の理論的関係は何か?
  • RQ3視覚的ヒントをどのように系統立てて空間的位置にマッピングすることで、意味のある擬似視覚ステレオペアを構築できるか?
  • RQ4擬似データは、教師ありおよび教師なしの両設定において、バイナリオ音声生成の一般化性能と性能を向上させることができるか?
  • RQ5直接HRIRまたはアンビソンクスデコーディングと比較して、提案手法のバイナリオデコーディング戦略は、主観的音質において優れているか?

主な発見

  • PseudoBinauralは、Mono2Binauralなどの教師あり手法と同等の主観的性能を達成し、評価の54.7%でステレオ感覚が好まれた。
  • 境界アリュード角π/3を用いた場合、STFT損失が0.878、SNRが5.316に達し、他の視野範囲設定を上回る性能を示した。
  • ユーザー実験の結果、PseudoBinauralは81%の音源位置特定精度を達成し、ベースライン手法に比べ顕著に優れていた。
  • アブレーションスタディの結果、HRIRとアンビソンクスデコーディングを組み合わせたアプローチが最良の主観的結果をもたらし、ユーザーが3D聴取体験を最も高く評価した。
  • 実際のバイナリオ録音と組み合わせた場合、PseudoBinauralは標準ベンチマークで性能が向上し、現在の最先端手法を上回った。
  • 可視化解析の結果、PseudoBinauralは実際に音源に注目している一方、Mono2Binauralは天井など関係のない領域に注目する傾向があることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。