Skip to main content
QUICK REVIEW

[論文レビュー] Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video

Rishabh Garg, Ruohan Gao|arXiv (Cornell University)|Nov 21, 2021
Speech and Audio Processing被引用数 12
ひとこと要約

本論文は、部屋のインパulse応答(RIR)、音源の空間的整合性、物体位置の時間的整合性といった視覚的幾何学的特徴を活用することで、モノラル動画音声を現実的なバイナリオン音声に変換する幾何学的注意を払ったマルチタスク学習フレームワークを提案する。動画からの空間的および幾何学的ヒントを明示的にモデル化することにより、実際およびシミュレートされたデータセットにおいて最先端の性能を達成し、新たに作成された大規模なフォトリアルなバイナリオン動画データセット「SimBinaural」を含む。

ABSTRACT

Binaural audio provides human listeners with an immersive spatial sound experience, but most existing videos lack binaural audio recordings. We propose an audio spatialization method that draws on visual information in videos to convert their monaural (single-channel) audio to binaural audio. Whereas existing approaches leverage visual features extracted directly from video frames, our approach explicitly disentangles the geometric cues present in the visual stream to guide the learning process. In particular, we develop a multi-task framework that learns geometry-aware features for binaural audio generation by accounting for the underlying room impulse response, the visual stream's coherence with the sound source(s) positions, and the consistency in geometry of the sounding objects over time. Furthermore, we introduce a new large video dataset with realistic binaural audio simulated for real-world scanned environments. On two datasets, we demonstrate the efficacy of our method, which achieves state-of-the-art results.

研究の動機と目的

  • 動画の多くにバイナリオン音声が欠落しているという問題に対処し、視覚的ヒントを用いてモノラル音声からバイナリオン音声への変換を可能にすること。
  • 部屋のインパulse応答(RIR)、音源の位置整合性、物体位置の時間的整合性といった幾何的要因を明示的にモデル化することで、空間的音声の現実性を向上させること。
  • シミュレートされたバイナリオン音声を備えた大規模でフォトリアルな動画データセットを構築し、バイナリオン音声生成のトレーニングおよび評価を支援すること。
  • 幾何学的および空間的制約を明示的にモデル化することで、暗黙的な視覚特徴学習に比べて優れた音声生成が達成されることを示すこと。

提案手法

  • 視覚的特徴からRIRを予測し、視覚的および音声的ソース間の空間的整合性を保証し、動画フレーム間で音源の幾何学的整合性を強制するという3つの目的を同時に最適化するマルチタスク学習フレームワークを導入する。
  • 視覚的特徴の抽出に共通の視覚エンコーダーを用い、RIR予測、空間的整合性、幾何学的整合性モデリングの各タスクに特化したヘッドを設ける。
  • 視覚的特徴がRIRパラメータ(例:初期反射、減衰時間)を予測し、シーン内の音源の方向と整合するようにする損失関数を組み込む。
  • 時間的滑らかさを確保するため、音源の幾何学的整合性を時間的にモデル化し、認識される音源位置の急激なシフトを防ぐ。
  • トレーニングおよび評価に使用可能な、3次元スキャンされた屋内環境とリアルなバイナリオン音声シミュレーションを備えた新規データセット「SimBinaural」を活用する。
  • 自己教師ありおよび教師あり信号の組み合わせを用いてエンドツーエンドでモデルをトレーニングし、データオーグメンテーションおよび対照的学習の要素を組み込んで特徴の汎化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1部屋の音響特性や音源位置といった幾何的ヒントを明示的にモデル化することで、動画からのモノラル→バイナリオン音声変換の性能が向上するか?
  • RQ2視覚的および音声的ソース間の空間的整合性を強制することで、生成されたバイナリオン音声の現実性および正確性にどのような影響を与えるか?
  • RQ3音源の時間的幾何学的整合性が、動画シーケンスにおける音声生成品質にどの程度寄与するか?
  • RQ4大規模でフォトリアルな、シミュレートされたバイナリオン音声を備えたデータセットは、実動画ベンチマークにおける一般化性能と性能向上に寄与するか?

主な発見

  • FAIR-Playベンチマークにおいて、本手法は最先端のモデルを上回り、真値RIRの監視がなくてもPESQスコア1.175およびSTOIスコア0.154を達成した。
  • SimBinauralおよびFAIR-Playの両方で共同トレーニングした場合、重複のないテストスプリットにおいて最良の性能を示し、合成データセットの一般化への利点を実証した。
  • ユーザースタディーの結果、本手法はベースラインと比較して、音源の方向(左/右/中央)の正確性およびバイナリオン音声の受動的質において、聴取者が好む傾向が見られた。
  • t-SNE可視化により、本手法の視覚的特徴がRT60などの音響パラメータを予測可能であるのに対し、ベースライン手法ではランダムな分布を示していることが確認された。
  • 活性化マップ解析により、本手法はAPNetと比較して、音源をより正確に局在化していることが判明した。APNetは広範囲に散らばった、焦点がぼけた注意を生成していた。
  • アブレーションスタディーにより、RIR予測、空間的整合性、幾何学的整合性の3つの損失を併用することで最良の性能が得られ、マルチタスク設計の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。