[論文レビュー] LEO: Generative Latent Image Animator for Human Video Synthesis
LEOは、潜在空間におけるフローマップを用いて外見と運動を分離することで、高精細な人間の動画合成のための画期的な生成フレームワークを提案する。潜在運動拡散モデル(LMDM)を用いて運動コードを生成し、フローベースの画像アニメーターを用いてワープ・インpaintによるフレーム合成を実現することで、優れた空間時間的整合性を達成し、無限長の動画生成とコンテンツ保持型編集を可能にする。
Spatio-temporal coherency is a major challenge in synthesizing high quality videos, particularly in synthesizing human videos that contain rich global and local deformations. To resolve this challenge, previous approaches have resorted to different features in the generation process aimed at representing appearance and motion. However, in the absence of strict mechanisms to guarantee such disentanglement, a separation of motion from appearance has remained challenging, resulting in spatial distortions and temporal jittering that break the spatio-temporal coherency. Motivated by this, we here propose LEO, a novel framework for human video synthesis, placing emphasis on spatio-temporal coherency. Our key idea is to represent motion as a sequence of flow maps in the generation process, which inherently isolate motion from appearance. We implement this idea via a flow-based image animator and a Latent Motion Diffusion Model (LMDM). The former bridges a space of motion codes with the space of flow maps, and synthesizes video frames in a warp-and-inpaint manner. LMDM learns to capture motion prior in the training data by synthesizing sequences of motion codes. Extensive quantitative and qualitative analysis suggests that LEO significantly improves coherent synthesis of human videos over previous methods on the datasets TaichiHD, FaceForensics and CelebV-HQ. In addition, the effective disentanglement of appearance and motion in LEO allows for two additional tasks, namely infinite-length human video synthesis, as well as content-preserving video editing.
研究の動機と目的
- 複雑なグローバルおよびローカル変形のため、人間の動画合成における空間時間的整合性の課題に対処すること。
- 従来の手法が外見と運動の厳密な分離を果たせず、空間的歪みや時間的ジターリングを引き起こすという限界を克服すること。
- 外見と運動の堅牢な分離を達成することで、長時間の動画生成とコンテンツ保持型動画編集を可能にする。
- 潜在運動空間における線形運動条件機構を通じて、任意長の動画をスケーラブルに生成するフレームワークの構築。
提案手法
- 運動を潜在空間におけるフローマップの系列として表現することで、外見から運動を本質的に分離する。
- 潜在運動コードからフローマップへのマッピングを学習できるフローベースの画像アニメーターを訓練し、ワープ・インpaint機構によるフレーム合成を実現する。
- 二段階の訓練戦略を実装する:まず、自己教師付き訓練により画像アニメーターを学習し、運動コードからフローマップへのマッピングを学習する。次に、運動の事前分布をモデル化するため、LMDMを運動コード上で訓練する。
- LMDMに線形運動条件(LMC)機構を導入し、初期コードからの運動コードの残差を生成することで、自己回帰的かつ長時間の動画生成を可能にする。
- 既成品の画像編集モデル(例:ControlNet)を活用し、初期フレームの編集を実施し、その外見的変更を全動画シーケンスにわたって伝搬させつつ、運動の整合性を維持する。
- 特に運動多様性が限られたデータセットにおいて、長時間生成における運動パターンのループを脱出するために、遷移拡散モデルを導入する。
実験結果
リサーチクエスチョン
- RQ1フローマップを運動表現として用いることで、人間の動画生成における外見と運動の有効な分離が可能かどうか。
- RQ2フローベースのワープによる外見と運動の分離が、エンドツーエンドまたは二ストリームアプローチと比較して、生成動画の空間時間的整合性を向上させるか。
- RQ3提案されたフレームワークが、一貫性のある運動と外見を維持したまま無限長の人の動画を生成できるか。
- RQ4外見と運動の分離を活用して、初期フレームのみを変更することで、コンテンツ保持型の動画編集をどの程度達成できるか。
- RQ5線形運動条件(LMC)機構が、劣化を伴わず長時間の動画生成を可能にするのにどの程度有効であるか。
主な発見
- LEOは、TaichiHDおよびFaceForensicsデータセットにおいて、LMCを用いた場合、FVDスコアがそれぞれ100.4および52.32と最先端の性能を達成し、ベースラインを大きく上回った。
- ユーザースタディーの結果、TaichiHDでは93.00%のユーザーがLEOの結果をTATSよりもリアルだと評価し、FaceForensicsでは91.33%のユーザーがStyleGAN-VよりもLEOを好んだ。
- 自己回帰的LMDM推論を用いて、FaceForensicsデータセットで1000フレームを超える動画を成功裏に生成し、無限長動画生成の実現可能性を示した。
- TaichiHDデータセットでは運動パターンが繰り返しのため、遷移拡散モデルの導入により、初期のループを超えた多様な運動パターンの生成が可能になった。
- 外見と運動の分離は実証的に妥当である:同一の初期フレームに異なる運動コードを適用すると、外見のずれを伴わず、異なる妥当な運動が生成された。
- 初期画像にControlNetを適用した編集により、顔貌の特徴や衣装などの外見的変更が成功裏に実現され、全シーケンスにわたって運動の一貫性が維持された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。