[論文レビュー] Audio-Driven Emotional Video Portraits
本稿では、制御可能な感情動態を備えた高精細で音声駆動型のビデオポートレートを生成するための新規手法である Emotional Video Portraits (EVP) を提案する。Cross-Reconstructed Emotion Disentanglement を用いて音声を感情に依存しない空間とコンテンツ依存空間に分離し、Target-Adaptive Face Synthesis を用いて合成された顔のキーポイントをターゲット動画のポーズと整合化することで、高視覚的精細度と正確な感情表現を維持しつつ、滑らかで連続的な感情編集を可能にする。
Despite previous success in generating audio-driven talking heads, most of the previous studies focus on the correlation between speech content and the mouth shape. Facial emotion, which is one of the most important features on natural human faces, is always neglected in their methods. In this work, we present Emotional Video Portraits (EVP), a system for synthesizing high-quality video portraits with vivid emotional dynamics driven by audios. Specifically, we propose the Cross-Reconstructed Emotion Disentanglement technique to decompose speech into two decoupled spaces, i.e., a duration-independent emotion space and a duration dependent content space. With the disentangled features, dynamic 2D emotional facial landmarks can be deduced. Then we propose the Target-Adaptive Face Synthesis technique to generate the final high-quality video portraits, by bridging the gap between the deduced landmarks and the natural head poses of target videos. Extensive experiments demonstrate the effectiveness of our method both qualitatively and quantitatively.
研究の動機と目的
- 既存の音声駆動型トーキングヘッド生成手法には感情モデリングが欠如しているという問題に取り組む。これらの手法は通常、唇の同期にのみ注目し、感情的ダイナミクスを無視する。
- 音声入力のみに依存して、制御可能で連続的な感情編集が可能なビデオポートレートを実現する。
- 音声から推定された顔のキーポイントとターゲットビデオポートレートの自然なヘッドポーズのギャップを埋め、高精細な合成を実現する。
- 音声における感情-コンテンツのエンタングルメントの課題を克服するため、相互再構成を通じて分離表現を学習する。
- 感情の正確性を維持しながら、リアルでポートレート一貫性のあるビデオフレームを生成する強固なフレームワークを開発する。
提案手法
- 音声を長さに依存しない感情空間と長さに依存するコンテンツ空間に分離するため、Cross-Reconstructed Emotion Disentanglement を提案し、分離表現学習を可能にする。
- 不均等な長さの音声データを補正するため、動的時間ワープ(DTW)を用いて、相互再構成損失の学習に適した擬似ペairedなトレーニングサンプルを生成する。
- 音声から顔のキーポイントを生成する音声→キーポイントアニメーションモジュールを採用し、分離された音声特徴から2次元の感情的顔キーポイント系列を生成する。
- 3次元に注意を払ったキーポイント整合化アルゴリズムを導入し、2次元キーポイントを3次元空間に投影し、ターゲット動画のヘッドポーズと輪郭とを整合化する。
- エッジからビデオへの変換ネットワークを適用し、整合化されたキーポイントとターゲット動画のエッジマップ・外観を融合することで、高品質なビデオポートレートを合成する。
- 相互再構成、コンテンツ、自己再構成、分類損失を含むマルチ損失学習方式を活用し、分離性と感情の正確性を向上させる。
実験結果
リサーチクエスチョン
- RQ1明示的な感情ラベルに依存せずに、音声駆動型ビデオ生成が制御可能で連続的な感情編集を達成できるか?
- RQ2生の音声から感情と音声コンテンツを効果的に分離し、独立した制御を可能にするにはどうすればよいか?
- RQ3合成された顔のキーポイントがターゲット動画の3次元ヘッドポーズとどの程度整合化できるか?視覚的アーティファクトを低減できるか?
- RQ4DTWに基づく擬似ペアを用いた相互再構成は、エンドツーエンド手法と比較して感情分離性と分類精度を向上させるか?
- RQ5提案手法は、音声入力からアイデンティティと感情的ダイナミクスを両方保持した高精細なビデオポートレートを生成できるか?
主な発見
- 提案手法の EVP は、MEAD テストセットで 83.58% の感情分類精度を達成し、Wang et al. [37] の 76.00% と比較して顕著に優れており、感情の正確性が向上していることを示している。
- アブレーションスタディの結果、相互再構成損失を除去すると感情分類精度が 69.79% に低下し、分離性に果たすその重要性が確認された。
- 3次元に注意を払ったキーポイント整合化を施した Target-Adaptive Face Synthesis は、キーポイントと顔の輪郭の間の目立つアーティファクトやずれを低減していることが、定性的比較で示された。
- 定量的アブレーションにより、4つの損失(相互再構成、コンテンツ、自己再構成、分類)がすべてキーポイント予測と分離性の向上に寄与していることが確認された。
- 潜在的感情空間における線形補間により、悲しみから喜びへの滑らかで一貫性のある感情遷移が実現され、連続的かつ制御可能な感情編集の能力が裏付けられた。
- 本手法は、定性的および定量的評価の両面で最先端の性能を達成しており、優れた視覚的品質と正確な感情制御を実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。