Skip to main content
QUICK REVIEW

[論文レビュー] Dynamics Transfer GAN: Generating Video by Transferring Arbitrary Temporal Dynamics from a Source Video to a Single Target Image

Wissam J. Baddar, Geonmo Gu|arXiv (Cornell University)|Dec 10, 2017
Generative Adversarial Networks and Image Synthesis参考文献 28被引用数 15
ひとこと要約

Dynamics Transfer GAN は、1枚のターゲット画像の空間的外観を保持したまま、ソース動画から任意の時間的ダイナミクスを転送することで動画を生成する。この手法は、ソース動画の動きを分離するためにアピアランス抑制型ダイナミクス特徴を用い、空間的忠実性と時間的整合性を保証する二重判別器を採用することで、ターゲット画像のアイデンティティが歪められない高品質で長時間の動画生成を実現する。

ABSTRACT

In this paper, we propose Dynamics Transfer GAN; a new method for generating video sequences based on generative adversarial learning. The spatial constructs of a generated video sequence are acquired from the target image. The dynamics of the generated video sequence are imported from a source video sequence, with arbitrary motion, and imposed onto the target image. To preserve the spatial construct of the target image, the appearance of the source video sequence is suppressed and only the dynamics are obtained before being imposed onto the target image. That is achieved using the proposed appearance suppressed dynamics feature. Moreover, the spatial and temporal consistencies of the generated video sequence are verified via two discriminator networks. One discriminator validates the fidelity of the generated frames appearance, while the other validates the dynamic consistency of the generated video sequence. Experiments have been conducted to verify the quality of the video sequences generated by the proposed method. The results verified that Dynamics Transfer GAN successfully transferred arbitrary dynamics of the source video sequence onto a target image when generating the output video sequence. The experimental results also showed that Dynamics Transfer GAN maintained the spatial constructs (appearance) of the target image while generating spatially and temporally consistent video sequences.

研究の動機と目的

  • ソース動画から任意の時間的ダイナミクスをターゲット画像に転送することで、高品質な動画シーケンスを生成すること。
  • 動画生成中にターゲット画像の空間的外観およびアイデンティティを保持すること。
  • シーケンス長に制限のない可変長の動画生成を可能にすること。
  • ソース動画の動きダイナミクスと空間的外観を分離し、正確な転送を可能にすること。
  • 生成された動画シーケンスにおける空間的忠実性と時間的整合性の両方を保証すること。

提案手法

  • 本手法は、ターゲット画像とソース動画シーケンスの特徴を統合して動画フレームを合成する生成器ネットワークを用いる。
  • 空間的外観を抑制したダイナミクス特徴を導入し、事前学習済みのRNNを用いた空間時間的符号化により、ソース動画の時間的ダイナミクスを保持しながらその空間的外観を抑制する。
  • 二つの判別器を採用する:フレームレベルの現実性と外観忠実性を検証する空間的判別器と、動画シーケンス全体における時間的整合性を評価するダイナミクス判別器。
  • 長期的な空間的およびダイナミクス的整合性を維持するため、生成器に追加の目的関数項を適用して訓練する。
  • ダイナミクス判別器は、長時間シーケンスの末尾部分に注目するように設計されており、時間経過に伴う品質の維持を保証する。
  • リアルさと動きの整合性を向上させるために、知覚的損失と対抗的損失を組み合わせた敵対的学習を用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット画像の空間的外観を歪めることなく、ソース動画の任意の時間的ダイナミクスを効果的に転送できるか?
  • RQ2ソース動画の空間的外観から動きダイナミクスを分離し、別の画像へ転送する方法は何か?
  • RQ3GANベースのモデルは、固定長の制約なしに長時間で時間的整合性のある動画シーケンスを生成できるか?
  • RQ4従来の空間時間的特徴(例:CNN-LSTM)と比較して、アピアランス抑制型ダイナミクス特徴を用いることで動画品質が向上するか?
  • RQ5二重判別器(空間的およびダイナミクス的)は、フレームレベルの現実性とシーケンスレベルの動き整合性の両方を効果的に強制できるか?

主な発見

  • 提案されたアピアランス抑制型ダイナミクス特徴は、特に高運動域や変形が強い領域で、生成フレームのアーティファクトを顕著に低減した。
  • 被験者による好み評価実験の結果、82.88%の参加者がアピアランス抑制型ダイナミクス特徴を用いた生成動画をCNN-LSTM特徴を用いたものよりも好んだ。
  • ゼロピixeLターゲット画像を用いた可視化により、モデルがソース動画のダイナミクスのみを生成し、空間的外観が効果的に抑制されていることが確認された。
  • モデルは、ソース動画から複雑で任意の動きパターンを効果的に取り込みつつ、ターゲット画像の空間的構造を正確に維持した。
  • 二重判別器の構成により、長時間にわたる動画シーケンスにおいてもフレームレベルの現実性と長期的な時間的整合性の両方が保証された。
  • 定性的な結果から、生成された動画は空間的および時間的に整合的であり、ターゲット画像のアイデンティティの歪みが最小限に抑えられていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。