Skip to main content
QUICK REVIEW

[論文レビュー] Generating Visually Aligned Sound from Videos

Peihao Chen, Yang Zhang|arXiv (Cornell University)|Jul 14, 2020
Speech and Audio Processing参考文献 42被引用数 4
ひとこと要約

本稿では、音声前方伝播正則化子を導入することで、トレーニング中に関連する音声成分と関係のない音声成分を分離する、視覚的に整合する音声を動画から生成するための新規フレームワークRegNetを提案する。ボトルネック型エンコーダーを介して真値音声特徴を活用することで、時間的およびコンテンツ面での整合性が向上し、生成音声の観察者をだませる割合が68.12%に達する。

ABSTRACT

We focus on the task of generating sound from natural videos, and the sound should be both temporally and content-wise aligned with visual signals. This task is extremely challenging because some sounds generated \emph{outside} a camera can not be inferred from video content. The model may be forced to learn an incorrect mapping between visual content and these irrelevant sounds. To address this challenge, we propose a framework named REGNET. In this framework, we first extract appearance and motion features from video frames to better distinguish the object that emits sound from complex background information. We then introduce an innovative audio forwarding regularizer that directly considers the real sound as input and outputs bottlenecked sound features. Using both visual and bottlenecked sound features for sound prediction during training provides stronger supervision for the sound prediction. The audio forwarding regularizer can control the irrelevant sound component and thus prevent the model from learning an incorrect mapping between video frames and sound emitted by the object that is out of the screen. During testing, the audio forwarding regularizer is removed to ensure that REGNET can produce purely aligned sound only from visual features. Extensive evaluations based on Amazon Mechanical Turk demonstrate that our method significantly improves both temporal and content-wise alignment. Remarkably, our generated sound can fool the human with a 68.12% success rate. Code and pre-trained models are publicly available at https://github.com/PeihaoChen/regnet

研究の動機と目的

  • 動画の視覚的コンテンツと時間的およびコンテンツ面で整合する音声を生成する課題に対処すること。
  • 動画フレームから推論できない視覚的に無関係な音声によって引き起こされる情報の不一致問題を解消すること。
  • トレーニング中に関連する音声成分を分離する監視メカニズムを導入することで、整合性の性能を向上させること。
  • 推論時に視覚特徴のみに依存して、高精細で現実的な音声を生成できるようにすること。

提案手法

  • RegNetは、音声予測のための視覚的ダイナミクスを捉えるために、時間依存の外観および運動特徴抽出モジュールを用いる。
  • 音声前方伝播正則化子は、真値音声をボトルネック特徴にエンコードし、トレーニング中に視覚特徴と融合する。
  • 正則化子は、生成器が視覚的および音声ボトルネック特徴を用いて真値音声を再構成できるようにすることで、強力な監視を提供する。
  • 推論時には音声前方伝播正則化子が削除され、音声生成が視覚特徴にのみ依存するようになる。
  • モデルはスペクトログラム再構成のためのL2損失と、音声の精細度を向上させるための識別器を用いた adversarial 損失で訓練される。
  • 正則化子の容量が性能に与える影響を調査するため、ダウンサンプリングレートSおよび出力次元Dを制御したRegNetの変種が評価される。

実験結果

リサーチクエスチョン

  • RQ1なぜ動画音声生成において時間的およびコンテンツ面での整合性は、音声合成と比べて特に困難であるのか?
  • RQ2トレーニングデータに視覚的に無関係な音声が存在する場合、既存のモデルの整合性性能がどのように低下するのか?
  • RQ3音声前方伝播正則化子は、トレーニング中に不要な音声成分を効果的に抑圧し、整合性を向上させることができるのか?
  • RQ4音声前方伝播正則化子の容量は、モデルが正しい視覚-音声マッピングを学習する能力にどのように影響するのか?
  • RQ5 adversarial 訓練は、RegNetフレームワークにおける生成音声の知覚的品質および現実性を向上させるのか?

主な発見

  • RegNetは、『本物か偽物か』テストにおいて観察者をだませる割合が68.12%に達し、ベースラインモデルを上回る性能を示した。
  • 最適なRegNet変種(S860D32)は、Dog-gaussデータで最小のL2距離(1.96)を達成し、狭い(D8)および広い(D1024)変種を上回った。
  • 広い変種(S860D1024)は、正規化子に過剰に依存することで、アクション発生時に音声を生成できない(Sound-Missingスコアが低い)ことが示された。
  • 狭い変種(S860D8)はノイズの多いスペクトログラムを生成し、正則化子からの情報が不十分であるため、誤ったマッピングを学習していることが示唆された。
  • adversarial 識別器を削除すると、人間の成功率が64.04%に低下し、音声の精細度向上にその役割があることが示された。
  • 主観的評価では、RegNetはすべての3つの整合性指標(Sound-Missing、Sound-Redundant、Sound-Mismatched)で最高の平均意見スコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。