[論文レビュー] MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement
MeshTalkは、カテゴリカルな潜在空間と新しいクロスモality損失を用いて、音声関連(例:口の動き)と音声非関連(例:まばたき、眉の動き)の顔面運動を分離する汎用的で音声駆動型の3次元顔面アニメーション手法を提案する。リアルさとリップシンクの正確さにおいて最先端の性能を達成し、知覚研究の参加者の75%がSOTAベースラインよりもMeshTalkを好んだ。
This paper presents a generic method for generating full facial 3D animation from speech. Existing approaches to audio-driven facial animation exhibit uncanny or static upper face animation, fail to produce accurate and plausible co-articulation or rely on person-specific models that limit their scalability. To improve upon existing models, we propose a generic audio-driven facial animation approach that achieves highly realistic motion synthesis results for the entire face. At the core of our approach is a categorical latent space for facial animation that disentangles audio-correlated and audio-uncorrelated information based on a novel cross-modality loss. Our approach ensures highly accurate lip motion, while also synthesizing plausible animation of the parts of the face that are uncorrelated to the audio signal, such as eye blinks and eye brow motion. We demonstrate that our approach outperforms several baselines and obtains state-of-the-art quality both qualitatively and quantitatively. A perceptual user study demonstrates that our approach is deemed more realistic than the current state-of-the-art in over 75% of cases. We recommend watching the supplemental video before reading the paper: https://github.com/facebookresearch/meshtalk
研究の動機と目的
- 音声に関連しない顔面ダイナミクス(例:まばたき、眉の動き)のモデル化が不十分であるために、従来の音声駆動型3次元顔面アニメーション手法が静的または不自然な上顔面運動を生成するという制限に対処する。
- 音声駆動型アニメーションにおける1対多のマッピング問題を、音声関連と音声非関連の顔面運動成分を分離することで克服する。
- 個人特化のトレーニングデータや高精細なモーションキャプチャを必要とせず、識別子に依存しない汎用的な3次元顔面アニメーションを可能にする。
- 音声入力とは独立して妥当で多様な上顔面運動(例:まばたき、眉の挙上)をモデル化することで、知覚的なリアルさと共articulation(共鳴)を向上させる。
- 識別子に依存しない再利用可能な顔面運動の潜在表現を学習することで、リターゲティングやメッシュダブイングなどの実用的応用を支援する。
提案手法
- 音声関連(例:口の形)と音声非関連(例:目を閉じる)の顔面運動成分を明示的に分離するカテゴリカルな潜在空間を導入する。
- 音声入力とは無関係に上顔面運動を正確に再構成し、音声のみに依存して正確なリップ運動を生成することを促進する、新しいクロスモダリティ損失を採用する。
- 学習済みの潜在空間上で自己回帰的サンプリング戦略を用いることで、時間的に整合的で高精細な3次元顔面アニメーションを音声から生成する。
- 1つのニュートラルな3次元顔面スキャンと音声入力のみを用いて、識別子特化のファインチューニングを必要とせずに完全な顔面アニメーションを生成する。
- ソース識別子のアニメートドメッシュからの潜在コードをターゲット識別子のニュートラルテンプレートメッシュにマッピングすることで、リターゲティングとメッシュダブイングを可能にする。
- ペアドされた音声と3次元メッシュシーケンスを用いて、エンドツーエンドにモデルを訓練する。損失関数は、分離とモダリティ特化の正確さを促進する。
実験結果
リサーチクエスチョン
- RQ1分離された潜在空間は、音声依存と音声非依存の顔面運動を分離することで、音声駆動型3次元顔面アニメーションのリアルさを向上させることができるか?
- RQ2リップ運動の正確さを保証すると同時に、まばたきや眉の動きといった妥当で多様な上顔面運動を維持するためには、どのようにクロスモダリティ損失を設計できるか?
- RQ3識別子に依存しない汎用的で、未観測の識別子に対しても一般化性能に優れたモデルは、個人特化モデルをどれほど上回ることができるか?
- RQ4分離された潜在表現は、リターゲティングや言語に依存しないメッシュダブイングといった実用的応用をサポートできるか?
- RQ5ユーザー研究において、提案手法は最先端のベースラインよりも優れた知覚的品質を達成しているか?
主な発見
- 知覚ユーザー研究において、MeshTalkは現在のSOTA手法(VOCA)よりも75%のケースで好まれ、66.4%のケースで明確に好まれ、わずか42.1%のケースで真値よりも低い順位にランク付けされたにとどまった。
- 定量的指標と視覚的検証により、音声入力と正確に一致する高精度なリップ運動が達成されていることが確認された。
- 音声の有無に関係なく、音声入力から分離されたため、まぶたの閉じる動作や眉の挙上といった上顔面運動が自然で妥当に多様に生成された。
- 分離された潜在空間により、顔の動きを1つの識別子から別の識別子に成功してリターゲティングでき、運動品質と識別子に依存しない運動パターンを保持した。
- 元の上顔面運動を維持したまま、新しい言語の音声に対してリシンセサイズされたリップ形状を生成することで、メッシュダブイングが成功した。これは、モダリティ分離が言語に依存しないアニメーションを可能にしていることを証明した。
- 定性的および定量的評価の両方で、複数のベースラインを上回り、音声駆動型3次元顔面アニメーション分野に新たな最先端の水準を確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。