Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Video Synthesis with Action Graphs

Amir Bar, Roei Herzig|arXiv (Cornell University)|Jun 27, 2020
Generative Adversarial Networks and Image Synthesis参考文献 70被引用数 6
ひとこと要約

本論文では、タイミングが付与られ、協調的に行われる動作を符号化する構造的動作グラフを条件として用いる、合成動画生成のための新規フレームワーク、Action Graph to Video (AG2Vid) を提案する。クロック付きエッジを用いて動作の進行を追跡し、階層的モデルでレイアウトと画素を予測することで、AG2Vid は意味的整合性と視覚的品質が向上した動画を生成し、CATER および Something-Something V2 において、訓練時に見なかった新しい動作構成に対し強力なゼロショット一般化を示した。

ABSTRACT

Videos of actions are complex signals containing rich compositional structure in space and time. Current video generation methods lack the ability to condition the generation on multiple coordinated and potentially simultaneous timed actions. To address this challenge, we propose to represent the actions in a graph structure called Action Graph and present the new ``Action Graph To Video'' synthesis task. Our generative model for this task (AG2Vid) disentangles motion and appearance features, and by incorporating a scheduling mechanism for actions facilitates a timely and coordinated video generation. We train and evaluate AG2Vid on the CATER and Something-Something V2 datasets, and show that the resulting videos have better visual quality and semantic consistency compared to baselines. Finally, our model demonstrates zero-shot abilities by synthesizing novel compositions of the learned actions. For code and pretrained models, see the project page https://roeiherz.github.io/AG2Video

研究の動機と目的

  • 現在の動画生成モデルが、複数の協調的かつタイミング付きの動作に対して制御不能であるという問題に対処すること。
  • 構造的入力表現を用いて、動画合成における動作の正確な空間時間的制御を可能にすること。
  • 学習済み動作の複雑な新しい組み合わせから、現実的でリアルな動画を合成できる生成モデルを開発すること。
  • 未見の動作の組み合わせやタイミングの変化に対するゼロショット一般化を評価すること。

提案手法

  • ノードが物体を表し、エッジが開始・終了時刻と空間的属性を含む動作を符号化する動作グラフ(AG)を用いて動作を表現する。
  • 動作の進行を時間経過に伴って追跡できる「クロック付きエッジ」を導入し、生成プロセスにおける時間的スケジューリングを可能にする。
  • クロック付きエッジを備えたAG上で動作するグラフニューラルネットワークを用い、フレームごとに中間的なシーンレイアウトを予測する。
  • 予測されたレイアウトを条件として、拡散モデルまたは自己回帰モデルを用いて画素レベルの動画生成を行う。
  • AGと生成された動画の整合性を保証するため、空間時間的損失を用いてモデルをエンドツーエンドで訓練する。
  • 生成品質と制御性の向上を図るため、分離された運動および外観特徴を統合する。

実験結果

リサーチクエスチョン

  • RQ1構造的入力を用いて、複数の同時でタイミングが付与された動作を効果的に条件付けた動画生成モデルは、実現可能か?
  • RQ2訓練時に見なかった動作の組み合わせに対しても、モデルはゼロショット一般化を示せるか?
  • RQ3モデルは、生成された動画における動作の正確なタイミングをどの程度制御できるか?
  • RQ4既存のベースラインと比較して、モデルは意味的整合性と視覚的品質をどの程度保持できるか?

主な発見

  • 人間評価において、AG2Vid は動作のタイミングを正しく再現する割合が 89.45% に達し、動作スケジューリングに対する正確な制御が確認された。
  • モデルは強力なゼロショット一般化を示し、CATER では平均クラスリコールが 96.65%、Something-Something V2 では 87.5% を達成した。
  • CATER および Something-Something V2 の両方で、AG2Vid が生成した動画は、ベースライン手法と比較して優れた視覚的品質と意味的整合性を示した。
  • 訓練時にこのような構成を一度も見なかったにもかかわらず、4つの物体と2つの同時動作、および3つの連続動作を含む複雑なAGに対しても、モデルは効果的に動画を生成できた。
  • クロック付きエッジの使用により、動作の進行状況を効果的に追跡でき、複数のエージェントや動作間での協調的な生成が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。