[論文レビュー] Talking-head Generation with Rhythmic Head Motion
本稿では、短い参照動画と音声を用いて頭部運動と顔の表情を明示的にモデル化することで、制御可能でリズミカルな頭部運動を伴う、写真のようにリアルでリップシンクが正確なトークイングヘッド動画を生成する、3Dに注意を向けた生成ネットワークを提案する。本手法は、最先端の手法と比較して、時間的整合性とアイデンティティの保持が優れている。
When people deliver a speech, they naturally move heads, and this rhythmic head motion conveys prosodic information. However, generating a lip-synced video while moving head naturally is challenging. While remarkably successful, existing works either generate still talkingface videos or rely on landmark/video frames as sparse/dense mapping guidance to generate head movements, which leads to unrealistic or uncontrollable video synthesis. To overcome the limitations, we propose a 3D-aware generative network along with a hybrid embedding module and a non-linear composition module. Through modeling the head motion and facial expressions1 explicitly, manipulating 3D animation carefully, and embedding reference images dynamically, our approach achieves controllable, photo-realistic, and temporally coherent talking-head videos with natural head movements. Thoughtful experiments on several standard benchmarks demonstrate that our method achieves significantly better results than the state-of-the-art methods in both quantitative and qualitative comparisons. The code is available on https://github.com/ lelechen63/Talking-head-Generation-with-Rhythmic-Head-Motion.
研究の動機と目的
- プロソディック情報を伝える自然でリズミカルな頭部運動を伴う、写真のようにリアルでリップシンクが正確なトークイングヘッド動画を生成すること。
- 顔の静止や、スパarsa/denseな監視に依存する既存手法の限界を克服すること。
- 音声によって顔の表情が駆動され、頭部の動きが参照動画から学習されることで、制御可能な生成を可能にすること。
- 3Dに注意を向けたモデリングと動的アピアランス埋め込みを通じて、視覚的整合性とアイデンティティの保持を向上させること。
- 編集用に完全な動画フレームを入力として必要としない高精細な合成を達成すること。
提案手法
- GANのトレーニングを安定化させ、頭部運動中のアライメントを改善するために、幾何的監視を提供する3Dに注意を向けたモジュールを導入する。
- K個の参照フレームから動的かつ特徴を統合するアピアランス特徴をモデル化するため、ハイブリッド埋め込みモジュールを採用する。
- 顔の表情、頭部運動、アピアランス特徴を正確な空間アライメントで融合する非線形合成モジュールを用いる。
- 3秒間の参照動画と音声からリズミカルな頭部運動を学習し、制御可能で自然な頭部ポーズ遷移を実現する。
- 頭部運動と顔の表情のモデリングを分離することで、分離性と制御性を向上させる。
- ランドマークのアノテーションや完全な動画編集に依存しない、音声と参照フレームを用いたエンドツーエンドのトレーニングを実施する。
実験結果
リサーチクエスチョン
- RQ1完全な動画フレームを入力としない生成モデルは、自然でリズミカルな頭部運動を伴う写真のようにリアルなトークイングヘッド動画を生成できるか?
- RQ2音声駆動の動画生成において、頭部運動と顔の表情を明示的に分離・制御する方法は何か?
- RQ33Dに注意を向けたモデリングは、アイデンティティの保持を向上させ、動的顔生成における視覚的アーチファクトを低減できるか?
- RQ4動的参照フレーム埋め込みは、グローバルなアピアランス符号化と比較して、より優れた一般化性と視覚的整合性をもたらすか?
- RQ5最先端の音声駆動およびランドマーク駆動手法と比較して、本手法は知覚的品質とリップシンクの正確性において優れているか?
主な発見
- 本手法は、VoxCeleb2およびLRS3-TEDデータセットにおいて、定量的指標と定性的評価の両面で最先端の性能を達成した。
- FID、SSIM、CSIMスコアにおいて、先行研究を顕著に上回り、CSIMスコアは未観測のアイデンティティへの一般化性が強いことを示している。
- ユーザースタディーの結果、自然な頭部運動を伴う動画は、静止顔の代替案と比較して、著しくリアルで同期が取れていると評価された。
- アブレーションスタディーでは、3Dに注意を向けたモジュールや非線形合成ブロックを削除すると、アイデンティティのずれや顔の縁付近の視覚的アーチファクトが顕著に増加した。
- K(参照フレーム数)が大きくなるほど性能が向上し、動的埋め込み戦略の有効性が裏付けられた。
- ランドマークやフレームレベルの監視に依存する手法と比較して、顔の変形が著しい状況でも、高品質で時間的に整合性のある動画を生成でき、優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。