[論文レビュー] StyleFaceV: Face Video Generation via Decomposing and Recomposing Pretrained StyleGAN3
StyleFaceV は、事前学習された StyleGAN3 の潜在空間を分解・再構成することで、高精細でアイデンティティを保持する顔動画生成のための新規フレームワークを提案する。潜在空間内で外見とポーズの表現を分離し、時間的LSTMを用いて動きの系列を生成し、画像と動画の共同学習戦略を採用することで、高精細な結果を達成した。1024×1024の動画合成で高解像度の動画学習データを一切使用しない状態でも最先端の性能を達成した。
Realistic generative face video synthesis has long been a pursuit in both computer vision and graphics community. However, existing face video generation methods tend to produce low-quality frames with drifted facial identities and unnatural movements. To tackle these challenges, we propose a principled framework named StyleFaceV, which produces high-fidelity identity-preserving face videos with vivid movements. Our core insight is to decompose appearance and pose information and recompose them in the latent space of StyleGAN3 to produce stable and dynamic results. Specifically, StyleGAN3 provides strong priors for high-fidelity facial image generation, but the latent space is intrinsically entangled. By carefully examining its latent properties, we propose our decomposition and recomposition designs which allow for the disentangled combination of facial appearance and movements. Moreover, a temporal-dependent model is built upon the decomposed latent features, and samples reasonable sequences of motions that are capable of generating realistic and temporally coherent face videos. Particularly, our pipeline is trained with a joint training strategy on both static images and high-quality video data, which is of higher data efficiency. Extensive experiments demonstrate that our framework achieves state-of-the-art face video generation results both qualitatively and quantitatively. Notably, StyleFaceV is capable of generating realistic $1024 imes1024$ face videos even without high-resolution training videos.
研究の動機と目的
- 事前学習済みの画像生成器を用いて、高精細でアイデンティティを保持し、動的かつ現実的な顔動画を生成する課題に対処すること。
- GAN の潜在空間にエンタングルメントが生じることで、アイデンティティの変化や不自然な動きを引き起こす既存手法の限界を克服すること。
- 高解像度の動画学習データを一切必要とせず、1024×1024 の顔動画生成を可能にすること。
- 限られた動画データと合成された画像ペアを活用する共同学習戦略を構築し、学習収束性と性能を向上させること。
提案手法
- 専用の特徴抽出ネットワークを用いて、StyleGAN3 の潜在空間を外見とポーズの分離表現に分解する。
- 固定された外見コードとサンプリングされたポーズ系列を統合することで、時間的に一貫性のある動画フレームを再構成する。
- 分解されたポーズ特徴に基づいて、LSTM を用いた時間的モデルを採用し、現実的で連続する動き表現を生成する。
- 実際の動画データと、StyleGAN3 の潜在空間内でアフィン変換を用いて生成された合成画像ペアを組み合わせる共同学習戦略を実装する。
- 潜在コード(w*)に自己教師型埋め込み損失を導入することで、学習の安定化と勾配の流れの維持を図り、再構成精度を向上させる。
- 訓練中に重み再バランスを適用し、画像ドメインにおけるアイデンティティ再構成よりも、微細な動き(例:口の動き)の捉え込みを優先する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みの StyleGAN3 の潜在空間を、動画生成に適した外見とポーズの成分に効果的に分離できるか?
- RQ2分離されたポーズ表現に基づいて、時間的に一貫性があり動的である動き系列をどのように合成できるか?
- RQ3限られた動画データと合成画像ペアを用いた共同学習戦略が、高解像度動画の監督なしにどれほど動画生成品質を向上させられるか?
- RQ4本フレームワークは、高解像度の学習動画が存在しない状況でも、高精細な 1024×1024 動画を生成できるか?
- RQ5潜在コード(w*)に対する自己教師型埋め込み損失は、画像レベルの再構成損失のみを用いる場合と比較して、モデルの収束性と再構成品質をどのように改善するか?
主な発見
- StyleFaceV は、FID-RAVDESS 15.42、FID-Mixture 25.31、FVD 118.72 を達成し、先行手法を大きく上回る最先端の性能を示した。
- 高解像度の学習動画が一切ない状況でも、1024×1024 の顔動画を高品質に生成でき、強力な一般化性能とデータ効率性を示した。
- 潜在コード(w*)に対する自己教師型埋め込み損失により再構成精度が向上し、FID-RAVDESS が 102.97(損失なし)から 15.42 に低下し、arcface類似度が 0.6676 から 0.7266 に向上した。
- 重み再バランスにより、微細な動き(例:口の動き)の捉え込みに注力でき、FVD が 722.84(再バランスなし)から 118.72 に低下した。
- 共同学習戦略により、画像の事前知識と限られた動画データを効果的に活用でき、アイデンティティを保持しながら現実的で時間的に一貫性のある動画を生成できた。
- 結果から、動画ドメインからの生成動画は画像ドメインからのものよりもより鮮やかな動きを示していることが明らかになったが、両者とも非常に現実的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。