[論文レビュー] V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation
V-Expressは、ポートレート動画生成におけるマルチモodal制御信号のバランスをとるために、条件付きドロップアウトと段階的訓練戦略を提案する。これにより、顔のアイデンティティとポーズ制御を維持しながら、音声駆動の口唇同期を効果的に実現できる。本手法は、AVSpeechで3.480のSyncNetスコア、TalkingHead-1KHで23.38のFIDを達成し、拡散ベース生成における強力な音声制御を示している。
In the field of portrait video generation, the use of single images to generate portrait videos has become increasingly prevalent. A common approach involves leveraging generative models to enhance adapters for controlled generation. However, control signals (e.g., text, audio, reference image, pose, depth map, etc.) can vary in strength. Among these, weaker conditions often struggle to be effective due to interference from stronger conditions, posing a challenge in balancing these conditions. In our work on portrait video generation, we identified audio signals as particularly weak, often overshadowed by stronger signals such as facial pose and reference image. However, direct training with weak signals often leads to difficulties in convergence. To address this, we propose V-Express, a simple method that balances different control signals through the progressive training and the conditional dropout operation. Our method gradually enables effective control by weak conditions, thereby achieving generation capabilities that simultaneously take into account the facial pose, reference image, and audio. The experimental results demonstrate that our method can effectively generate portrait videos controlled by audio. Furthermore, a potential solution is provided for the simultaneous and effective use of conditions of varying strengths.
研究の動機と目的
- 顔の動画生成において、特に強い信号(例:ポーズ、参照画像)が弱い信号(例:音声)を圧倒するという制御信号強度の不均衡を解消すること。
- 強い信号による干渉のため、しばしば生成に影響を及げない弱い制御信号(例:音声)を効果的かつ安定的に学習可能にする方法の確立。
- 強度の異なる複数の制御信号を、1つの生成フレームワーク内で同時にかつ効果的に統合する手法の開発。
- 生成されたポートレート動画における顔のアイデンティティとポーズの一貫性を維持しながら、音声駆動の口唇同期を向上させること。
提案手法
- V-Expressは、VAEエンコーダーとデコーダーを備えた潜在変動拡散モデル(LDM)を用い、潜在空間上で画像から動画への生成を実行する。
- 3つの制御ヘッドを採用:アイデンティティ制御のためのReferenceNet、顔のポーズ制御のためのV-Kps Guider、音声駆動の口唇運動のためのAudio Projection。
- 訓練時に条件付きドロップアウトを適用:V-Kpsと参照画像の特徴量は、それぞれ50%および20%のドロップアウト率でランダムにマスクされ、支配的になるのを防ぐ。
- 段階的訓練により、弱い信号(例:音声)の強度を段階的に増加させる。ドロップアウト率と信号注入のスケジューリングを訓練段階に応じて制御する。
- マルチステージ訓練パイプラインを採用:第I段階では音声なしで動画フレーム(VFHQを用いて)を学習し、第II段階と第III段階で段階的に音声を導入し、制御を精緻化する。
- 拡散モデル内のクロスアテンション重みを分析し、音声アテンションが口元の動きに影響を与えるように調整可能であることを確認。これにより、信号の制御可能性が裏付けられる。

実験結果
リサーチクエスチョン
- RQ1強い信号(例:ポーズ、参照画像)が支配的である状況下でも、弱い制御信号(例:音声)をポートレート動画生成に効果的に統合できるか。
- RQ2段階的訓練と条件付きドロップアウトは、マルチ条件生成における弱い信号の収束性と制御忠実度をどのように向上させるか。
- RQ3顔のアイデンティティやポーズの正確性を損なわず、音声駆動の口唇同期をどの程度達成できるか。
- RQ4本手法は、強度の異なる複数の制御信号をバランスよく統合しながら、高品質で時間的整合性の取れた動画を生成できるか。
主な発見
- AVSpeechデータセットにおいて、V-Expressは3.480のSyncNetスコアを達成し、Wav2Lip(6.890)とDiffusedHeads(スコア未提供)を上回り、優れた口唇同期性能を示している。
- TalkingHead-1KHデータセットでは、FIDが25.81、FVDが135.82と、Wav2Lip(FID: 29.06、FVD: 250.95)とDiffusedHeads(FID: 115.41、FVD: 344.69)を顕著に上回っている。
- TalkingHead-1KHでは、アイデンティティのずれが3.63(ΔFaceSim)減少し、真値と比較して顔のアイデンティティ保持性が優れていることが示された。
- KpsDisはTalkingHead-1KHで3.28にまで低下し、生成された顔のポーズとターゲットポーズとの整合性が向上していることが確認された。
- 視覚的結果から、音声アテンション重みを調整することで口元の動きの強度を制御可能であることが確認され、音声信号の制御可能性が裏付けられた。
- アブレーションスタディの結果、条件付きドロップアウトが強い信号からの干渉を効果的に低減し、音声が生成に意味的な影響を及げることを可能にした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。