Skip to main content
QUICK REVIEW

[論文レビュー] Animating Landscape: Self-Supervised Learning of Decoupled Motion and Appearance for Single-Image Video Synthesis

Yuki Endo, Yoshihiro Kanamori|arXiv (Cornell University)|Oct 16, 2019
Advanced Vision and Imaging被引用数 4
ひとこと要約

本論文では、1枚の風景画像から高解像度で長期間にわたるアニメーションを生成するための自己教師あり、分離型ディープラーニング手法を提案する。運動と外観を別々に予測する(運動は逆方向の流れ場によって、外観は色移動関数によって)、各フレームで元の入力画像に対してのみこれらの中間表現を適用することで、誤差の蓄積を回避し、優れた時間的整合性と解像度を実現した制御可能で周期的な動画合成を可能にする。

ABSTRACT

Automatic generation of a high-quality video from a single image remains a challenging task despite the recent advances in deep generative models. This paper proposes a method that can create a high-resolution, long-term animation using convolutional neural networks (CNNs) from a single landscape image where we mainly focus on skies and waters. Our key observation is that the motion (e.g., moving clouds) and appearance (e.g., time-varying colors in the sky) in natural scenes have different time scales. We thus learn them separately and predict them with decoupled control while handling future uncertainty in both predictions by introducing latent codes. Unlike previous methods that infer output frames directly, our CNNs predict spatially-smooth intermediate data, i.e., for motion, flow fields for warping, and for appearance, color transfer maps, via self-supervised learning, i.e., without explicitly-provided ground truth. These intermediate data are applied not to each previous output frame, but to the input image only once for each output frame. This design is crucial to alleviate error accumulation in long-term predictions, which is the essential problem in previous recurrent approaches. The output frames can be looped like cinemagraph, and also be controlled directly by specifying latent codes or indirectly via visual annotations. We demonstrate the effectiveness of our method through comparisons with the state-of-the-arts on video prediction as well as appearance manipulation.

研究の動機と目的

  • 1枚の静止風景画像から高品質で長期間にわたる動画を生成する課題に取り組むこと。運動と外観は異なる時間スケールで変化する。
  • 生成されたフレームに対して再帰的に適用するのではなく、入力画像に直接適用することで、運動と外観の予測を分離し、長期間の動画予測における誤差蓄積を低減すること。
  • 潜在コードと視覚的アノテーションを用いて制御可能な動画生成を可能とし、運動と外観の直接的および間接的な制御を提供すること。
  • 自己教師あり学習を時間遅延動画データセットに適用することで、教師なしで最先端の手法を上回る解像度と動画品質を実現すること。

提案手法

  • 本手法は2つの独立した畳み込みニューラルネットワークを用いる。1つは運動をモデル化するための逆方向の光流場を予測し、もう1つは外観変化をモデル化するための空間的に滑らかな色移動関数を予測する。
  • 運動は逆方向の流れ場を用いてフレーム間の差分としてモデル化され、入力画像を歪ませることで中間的な運動に影響を受けるフレームを生成する。
  • 外観の変化は、入力フレームと時間遅延動画内の任意のフレームとの間の色移動関数としてモデル化され、時間的に補間されて滑らかな色の遷移を実現する。
  • 潜在コードを用いて将来の予測における不確実性をモデル化し、推論時に現実的で多様な出力を保証するための正則化を施す。
  • 最終的な動画フレームは、各出力フレームごとに予測された流れ場と色移動関数を元の入力画像に一度だけ適用することで合成される。これにより、再帰的誤差伝播を回避する。
  • 潜在コードのサンプリングまたは視覚的アノテーションを用いることで制御が可能となり、運動と外観の直接的または間接的な操作が可能になる。

実験結果

リサーチクエスチョン

  • RQ1自然風景における運動と外観を、異なる時間スケールで効果的に分離し、モデル化することで動画合成の品質を向上させることができるか?
  • RQ2時間遅延動画データセットに対する自己教師あり学習により、教師なしで高解像度で長期間にわたる動画生成が可能になるか?
  • RQ3中間表現(流れ場と色移動関数)を入力画像に直接適用することで、再帰的生成と比較して誤差蓄積が低減するか?
  • RQ4潜在コードを用いることで、1枚の画像から制御可能で多様かつ現実的な動画生成が可能になるか?
  • RQ5エンドツーエンドのフレーム予測と比較して、分離型の中間表現アプローチは解像度、整合性、時間的安定性において優れているか?

主な発見

  • 本手法は1024×576解像度の高解像度動画を生成でき、従来の1枚の画像からの動画合成手法を著しく上回る。
  • 誤差蓄積が低減された長期間の動画シーケンスが得られ、500フレームでも安定した視覚的品質を示したが、非常に長いシーケンスでは若干の歪みが観察された。
  • 潜在コードや視覚的アノテーションを用いて運動と外観を独立して制御でき、同じ入力画像から多様で現実的なアニメーションを生成できる。
  • 流れ場と色移動関数といった中間表現を入力画像に一度だけ適用することで、再帰的生成で一般的な誤差蓄積を防ぎ、長期的な整合性を向上させた。
  • 定量的および定性的な比較により、視覚的品質と時間的整合性の両面で、最先端の動画予測および外観操作モデルを上回る性能を示した。
  • 自然にループする周期的なアニメーションを成功裏に生成し、現実的で時間的に変化するシーンのダイナミクスをモデル化できる能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。