[論文レビュー] FaceFormer: Speech-Driven 3D Facial Animation with Transformers
FaceFormer は、長期間にわたる音声の文脈と自己教師あり音声表現を活用して、リアルで時間的に整合性のある 3D フェイスメッシュと正確なリップシンクを生成するトランスフォーマー基盤の自己回帰的モデルを提案する。バイアス付きクロスアテンションと周期的位置エンコーディング戦略を導入し、知覚的評価とより長い音声シーケンスへの一般化において最先端の手法を上回る性能を発揮する。
Speech-driven 3D facial animation is challenging due to the complex geometry of human faces and the limited availability of 3D audio-visual data. Prior works typically focus on learning phoneme-level features of short audio windows with limited context, occasionally resulting in inaccurate lip movements. To tackle this limitation, we propose a Transformer-based autoregressive model, FaceFormer, which encodes the long-term audio context and autoregressively predicts a sequence of animated 3D face meshes. To cope with the data scarcity issue, we integrate the self-supervised pre-trained speech representations. Also, we devise two biased attention mechanisms well suited to this specific task, including the biased cross-modal multi-head (MH) attention and the biased causal MH self-attention with a periodic positional encoding strategy. The former effectively aligns the audio-motion modalities, whereas the latter offers abilities to generalize to longer audio sequences. Extensive experiments and a perceptual user study show that our approach outperforms the existing state-of-the-arts. The code will be made available.
研究の動機と目的
- 長期間の音声シーケンスに対しても、リアルで時間的に安定した 3D フェイスアニメーションを生成する課題に対処すること。
- wav2vec 2.0 などの自己教師あり事前学習済み音声表現を活用することで、3D 音声視覚データセットにおけるデータ不足を克服すること。
- 長距離の音声文脈とモーション履歴をモデル化することで、リップシンクと顔の表情のリアリズムを向上させること。
- クロスアテンションにおける新しいアライメントバイアスを用いて、音声と顔の動きのモダリティをより良好に統合すること。
- 周期的位置エンコーディング戦略を用いて、学習時に見られなかったより長い音声シーケンスへの一般化を可能にすること。
提案手法
- モデルは、長距離の音声文脈を捉えるために自己教師あり wav2vec 2.0 表現を用いて入力音声を処理するトランスフォーマー エンコーダーを採用する。
- 自己回帰的デコーダーは、フレームごとに 3D フェイスメッシュを予測し、因果的自己アテンションを用いて時間的安定性を確保するためのモーション履歴をモデル化する。
- 音声とモーションのモダリティをアライメントするために、クエリ-キー評価にアライメントバイアスを注入する、バイアス付きマルチヘッドクロスモーダルアテンション機構を導入する。
- デコーダーの自己アテンションに周期的位置エンコーディング(PPE)戦略を適用し、時間的バイアスと正弦波埋め込みを組み合わせることで、より長いシーケンスへの一般化を向上させる。
- モデルは、入力として生の音声、出力として 3D メッシュ頂点の系列を用いて、3D フェイスモーションシーケンスに対してエンドツーエンドで学習する。
- RNN を用いた再帰構造を避け、長距離依存性と局所的ダイナミクスの両方を自己アテンションのみに依存してモデル化する。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマー基盤のアーキテクチャは、正確なリップシンクを実現するための長期間の音声文脈を効果的にモデル化できるか?
- RQ2自己教師あり音声表現は、3D フェイスアニメーションにおける低データ環境下での性能向上にどのように寄与するか?
- RQ3音声と顔の動きの間のクロスアテンションにおいて、モダリティアライメントは果たす役割を果たし、バイアス機構によってどのように強化できるか?
- RQ4修正された位置エンコーディング戦略は、学習時に見られなかったより長い音声シーケンスへの一般化を向上させることができるか?
- RQ5自己回帰的予測と自己アテンションを用いたアプローチは、再帰モデルと比較して、モーションの整合性とリップシンクの正確性において優れているか?
主な発見
- 知覚的ユーザー評価において FaceFormer は最先端の手法を上回り、参加者の57.78%がそのフェイスアニメーションをベースラインモデルよりもよりリアリストィックと評価した。
- リップシンクの性能が顕著に向上し、62.22%のユーザーが、オリジナルの正弦波位置エンコーディングを用いたベースラインと比較して、FaceFormer のリップモーションが音声とより整合していると感じた。
- クロスアテンションにおけるアライメントバイアスを除去すると、顔の表情が鈍くなり不自然になるため、モダリティアライメントのためにはそのバイアスが不可欠であることが確認された。
- 周期的位置エンコーディング(TB+PPE)戦略により、学習時とは異なるより長い音声シーケンスへの一般化が向上し、ALiBi や標準的な正弦波エンコーディングを用いたモデルで見られる時間的ジッターや静止状態の凍結問題が軽減された。
- 自己アテンションを用いた自己回帰的デコーダーは、全結合(FC)デコーダーやLSTMベースの代替手法と比較して、より時間的に整合性があり安定したリップモーションを生成した。
- 20秒の音声クリップ(平均学習長さの4倍以上)を用いたAMTベンチマークにおいて、FaceFormer は高品質なアニメーションを維持したが、標準的な位置エンコーディングを用いたモデルは、無音フレームで不安定さを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。