Skip to main content
QUICK REVIEW

[論文レビュー] Sep-Stereo: Visually Guided Stereophonic Audio Generation by Associating Source Separation

Hang Zhou, Xudong Xu|arXiv (Cornell University)|Jul 20, 2020
Speech and Audio Processing参考文献 50被引用数 13
ひとこと要約

本論文では、音源分離を空間的音声生成の極端なケースとして扱うことで、ステレオ音声生成と音源分離を統合的に学習する統一的なディーブラーニングフレームワーク、Sep-Stereoを提案する。音声視覚特徴統合にアソシエイティブピラミッドネットワーク(APNet)を用いた共有バックボーンを採用し、豊富なモノラル音声データを活用することでバイナリ音声合成の性能を向上させ、ステレオ学習データの67%のみで最先端の性能を達成しつつ、分離精度を維持した。

ABSTRACT

Stereophonic audio is an indispensable ingredient to enhance human auditory experience. Recent research has explored the usage of visual information as guidance to generate binaural or ambisonic audio from mono ones with stereo supervision. However, this fully supervised paradigm suffers from an inherent drawback: the recording of stereophonic audio usually requires delicate devices that are expensive for wide accessibility. To overcome this challenge, we propose to leverage the vastly available mono data to facilitate the generation of stereophonic audio. Our key observation is that the task of visually indicated audio separation also maps independent audios to their corresponding visual positions, which shares a similar objective with stereophonic audio generation. We integrate both stereo generation and source separation into a unified framework, Sep-Stereo, by considering source separation as a particular type of audio spatialization. Specifically, a novel associative pyramid network architecture is carefully designed for audio-visual feature fusion. Extensive experiments demonstrate that our framework can improve the stereophonic audio generation results while performing accurate sound separation with a shared backbone.

研究の動機と目的

  • 豊富なラベルなしモノラル音声データを活用することで、ラベル付きステレオ音声データの不足を補い、音声生成性能を向上させること。
  • 共有表現学習を用いてステレオ音声生成と音源分離を統一的なフレームワークに統合すること。
  • モノラルデータでの事前学習と限定的ステレオデータでの微調整により、低データ環境下での一般化性能を向上させること。
  • 新しいアソシエイティブ特徴統合メカニズムにより、より効率的かつ解釈可能な音声視覚連関を実現すること。

提案手法

  • フレームワークは、音源分離を、視覚的認識の端縁に局在化された音源としてのバイナリ音声生成の特殊ケースとして扱う。
  • 学習可能なアソシエイティブコンボリューション操作を用いて、視覚特徴とスペクトログラム応答を明示的に関連付けるアソシエイティブピラミッドネットワーク(APNet)を提案する。
  • 2つの異なるヘッドを用いたマルチタスク学習を採用:一方はステレオ音声生成(FAIR-Playデータセットを用い)、他方は音源分離(MUSICデータセットを用い)。
  • 共有バックボーンが両モodalを処理することで、パラメータ効率とタスク間の共同最適化を実現する。
  • 顕著な視覚領域を対応する音響エネルギー応答にマッピングすることで、音声視覚整合性を強制する。
  • モノラルおよびステレオデータを用いて、ステレオ再構成損失と分離損失の組み合わせにより、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1音源分離は、極端な空間的音声生成の一種として効果的に再解釈可能か?
  • RQ2共有表現を用いて、統一フレームワークでステレオ音声生成と音源分離を同時に最適化できるか?
  • RQ3大規模なモノラル音声データでの事前学習が、低データステレオ音声生成における性能と一般化能力を向上させられるか?
  • RQ4提案された音声視覚連関統合メカニズムは、視覚的キューと空間的音声特徴をどの程度効果的に一致させられるか?

主な発見

  • 提案されたSep-Stereoフレームワークは、FAIR-Playデータセットの学習データの67%のみを用いても、最先端のステレオ音声生成モデルと同等の性能を達成した。
  • モデルは音源分離タスクにおいても競争力のある性能を維持しており、共有バックボーンが効果的に分離可能な音源表現を捉えていることを示した。
  • ユーザースタディーの結果、60%の参加者が音声視覚一致品質においてベースラインのMono2Binauralモデルよりも生成音声を好んだ。
  • 大規模なモノラルデータでの事前学習のおかげで、分布外や現実世界のモノラルシナリオに対しても一般化性能が向上した。
  • 可視化結果から、モデルがインストゥルメンツや人物などの視覚的に顕著な音源に注目していることが確認され、効果的な音声視覚マッピングが学習されていることが示された。
  • 相対的性能向上曲線は、さまざまなデータ規模下でも一貫した改善を示しており、低データ条件におけるロバスト性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。