Skip to main content
QUICK REVIEW

[論文レビュー] Visual to Sound: Generating Natural Sound for Videos in the Wild

Yipin Zhou, Zhaowen Wang|arXiv (Cornell University)|Dec 4, 2017
Music and Audio Processing被引用数 5
ひとこと要約

本論文は、制御不能な現実世界の環境において、ビデオフレームから自然で時間的に同期された音声波形を生成する学習ベースの手法を提案する。ビデオエンコーダーと階層的RNNベースの音声生成器を用いることで、人間が信じるに足る結果を達成し、ユーザースタディーでは70%以上の生成音声が「本物」と認識された。これは、視覚入力からの音声生成における強力な汎化性と現実性を示している。

ABSTRACT

As two of the five traditional human senses (sight, hearing, taste, smell, and touch), vision and sound are basic sources through which humans understand the world. Often correlated during natural events, these two modalities combine to jointly affect human perception. In this paper, we pose the task of generating sound given visual input. Such capabilities could help enable applications in virtual reality (generating sound for virtual scenes automatically) or provide additional accessibility to images or videos for people with visual impairments. As a first step in this direction, we apply learning-based methods to generate raw waveform samples given input video frames. We evaluate our models on a dataset of videos containing a variety of sounds (such as ambient sounds and sounds from people/animals). Our experiments show that the generated sounds are fairly realistic and have good temporal synchronization with the visual inputs.

研究の動機と目的

  • 制御不能な現実世界の環境において、ビデオフレームから自然で生の音声波形を生成する手法を開発すること。
  • 多様な現実世界の音声(環境ノイズ、人間・動物の相互作用など)を含む動画における視覚-音声連関の学習に挑戦すること。
  • 28,109本の動画(55時間)を10の音声カテゴリに分けて、高品質でクリーニングされたデータセットを構築し、トレーニングと評価を支援すること。
  • 定量的指標と人間の認知スタディーの両方を用いて、生成音声の現実性と同期性を評価すること。
  • 最適な音声生成性能を得るための複数の視覚エンコーディングアーキテクチャ(フレーム、逐次、フローベース)を検討・比較すること。

提案手法

  • モデルはビデオエンコーダーに続き、階層的再帰ニューラルネットワーク(RNN)を用いて、段階的に生の音声波形サンプルを生成する。
  • 3つの視覚エンコーディングバリエーションを検討:フレームレベルのエンコーディング、フレームの系列をRNNで処理する逐次エンコーディング、運動のダイナミクスを捉えるための光流ベースのエンコーディング。
  • 音声生成ネットワークは、生の音声信号の自己回帰的生成を目的とした階層的RNNアーキテクチャであるSampleRNNに基づく。
  • 2秒ごとの時間的整合性と関連性を保つために、AudioSetのサブセットをクリーニングして独自のデータセットを構築した。
  • トレーニングプロセスは、視覚入力を生の音声にマップするエンドツーエンド学習であり、波形忠実度と時間的整合性を最適化する損失関数を用いる。
  • 評価には数値指標と、動画-音声ペアが本物か生成物かを判断する人間のスタディーを併用した。

実験結果

リサーチクエスチョン

  • RQ1制御不能な現実世界の環境において、生のビデオフレームからリアルで時間的に同期された音声を生成できるか?
  • RQ2異なる視覚エンコーディング戦略(フレーム、系列、光流)は、生成音声の品質と現実性にどのように影響するか?
  • RQ3生成音声が、本物の音声やランダムな音声ベースラインと比較して、人間の聴取者をどれほど欺けるか?
  • RQ4モデルは複数の音声カテゴリにわたってどのように汎化するか?また、マルチカテゴリ生成における限界は何か?
  • RQ5音声品質と同期性の観点から、先行研究と比較して本モデルはどのように差をつけるか?

主な発見

  • 提案手法は、生成音声と本物の音声を識別する人間評価で73.36%の正確度を達成し、平均して73.36%の生成ペアが「本物」と判断された。
  • フローに基づく視覚エンコーダーは、フレーム法と系列法を上回り、水の流れの音では81.25%、ヘリコプターの音では78.13%の現実性評価を得た。
  • ドッグとドラムのカテゴリでは、それぞれ64.32%および70.83%の現実性評価を達成し、ベースライン(54.69%および59.64%)と[15]の上限法(40.16%および43.75%)を顕著に上回った。
  • マルチカテゴリモデルは46.29%の人の認識正確度を示し、カテゴリ間での汎化性を示したが、最良の単一カテゴリモデル(73.63%)には及ばなかった。
  • グレatest Hitsデータセットでも競争力のある性能を示し、生成音声の41.50%が人間によって本物の音声よりも好まれ、[15]の40.01%と同等の結果を得た。
  • 本物の音声ベースラインは平均91.43%の確率で正しく識別されたことから、タスクの難易度と人間の認識の鋭さが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。