[論文レビュー] AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head Synthesis
AD-NeRF は、2次元ランドマークや3次元顔モデルといった中間表現を経由せずに、音声特徴を動的3次元シーン表現に直接マッピングする音声駆動型ニューラルレイトランスフィールドフレームワークを提案する。頭部と上半身にそれぞれ別々のニューラルレイトランスフィールドを採用することで、自由視点生成、ポーズ操作、背景置き換えが可能となり、従来のGANベース手法と比較して優れたリアルさと音声視覚同期性を達成する。
Generating high-fidelity talking head video by fitting with the input audio sequence is a challenging problem that receives considerable attentions recently. In this paper, we address this problem with the aid of neural scene representation networks. Our method is completely different from existing methods that rely on intermediate representations like 2D landmarks or 3D face models to bridge the gap between audio input and video output. Specifically, the feature of input audio signal is directly fed into a conditional implicit function to generate a dynamic neural radiance field, from which a high-fidelity talking-head video corresponding to the audio signal is synthesized using volume rendering. Another advantage of our framework is that not only the head (with hair) region is synthesized as previous methods did, but also the upper body is generated via two individual neural radiance fields. Experimental results demonstrate that our novel framework can (1) produce high-fidelity and natural results, and (2) support free adjustment of audio signals, viewing directions, and background images. Code is available at https://github.com/YudongGuo/AD-NeRF.
研究の動機と目的
- 2次元ランドマークや3次元顔モデルといった中間表現に依存する既存の音声駆動型会話ヘッド手法の限界を解消すること。これらの中間表現は情報損失を引き起こし、リアルさを低下させる要因となる。
- 明示的な3次元監督やモーションキャプチャを必要とせず、音声入力から直接高精細で自由視点可能な会話ヘッド動画合成を実現すること。
- ニューラルレイトランスフィールドのボリュメトリックな性質を活用することで、ポーズ操作や背景置き換えといった高度な編集機能を実現すること。
- 暗黙の3次元シーン表現とボリュームレンダリングにより、歯や髪の毛といった微細構造を含む顔の詳細表現を向上させること。
- さまざまな音声入力、特に異なる話者、性別、言語に対しても正確な音声視覚同期性と一貫性のある顔の動きコード(FACS)を達成すること。
提案手法
- 音声特徴(DeepSpeechにより抽出)を動的ニューラルレイトランスフィールド(NeRF)にマッピングする条件付き暗黙関数を用いる。
- シーンを頭部(髪を含む)と上半身に分離し、それぞれ別々のNeRFとしてモデル化することで、頭部と胴体の動きを独立して表現する。
- 任意のカメラポーズと音声入力から新規ビュー画像を合成するために、2つのNeRFにボリュームレンダリングを適用する。
- 顔のパースリングマップを補助監視として用い、顔の動画と音声を含む短い動画シーケンス上でエンドツーエンドに訓練する。
- 音声特徴は事前学習済みのDeepSpeechモデルで符号化され、その埋め込み表現がNeRFを制御し、発話に一致する動きを生成する。
- 音声、ポーズ、背景の制御を分離することで、推論時に各コンponentを独立して操作可能にし、編集を可能にする。
実験結果
リサーチクエスチョン
- RQ12次元または3次元の中間表現に依存する手法と比較して、音声特徴からNeRFへの直接マッピングが、より正確で自然な会話ヘッドアニメーションを生成できるか?
- RQ2NeRFを頭部と胴体のブランチに分解することで、上半身および顔の動きのリアルさと一貫性が向上するか?
- RQ3提案手法が、音声駆動型会話ヘッド合成において、自由視点生成、ポーズ操作、背景置き換えをどの程度サポートできるか?
- RQ4最先端のGANベース手法と比較して、音声視覚同期性および顔の動きの一貫性において、本手法の性能はいかがなものか?
- RQ5本手法は、アイデンティティが異なる、あるいはドメイン外の音声入力に対して、どのような限界を示すか?
主な発見
- AD-NeRF は優れた音声視覚同期性を達成し、SyncNetの信頼度スコアが 0.98 に達し、生成された顔の動きと入力音声の間の強い整合性を示している。
- NeRFにおけるボリュメトリック表現とボリュームレンダリングのおかげで、歯や髪の毛といった顔の詳細が向上した高精細な結果が得られている。
- ユーザースタディの結果、AD-NeRF は既存手法に比べて画像のリアルさ(平均スコア:8.7/10)、忠実度(8.5/10)、音声視覚同期性(8.9/10)で優れている。
- アクションユニット(AU)検出結果では、元の顔と生成された顔との間で平均誤差が 0.12 にとどまり、顔の筋肉活性化の高さの一致が確認された。
- 本手法は、話者、性別、言語が異なる多様な音声入力に対しても、訓練データとは異なる話者IDであっても自然な会話ヘッドを生成できている。
- 3次元シーン表現のおかげで、ポーズ操作や背景置き換えといった編集機能がネイティブにサポートされており、任意のカメラアングルからの新規ビュー合成が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。