Skip to main content
QUICK REVIEW

[論文レビュー] Learning Dynamic Facial Radiance Fields for Few-Shot Talking Head Synthesis

Shuai Shen, Wanhua Li|arXiv (Cornell University)|Jul 24, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、わずか数秒間の学習データで未学習のアイデンティティに迅速に一般化できる、少量学習向けの会話ヘッド合成手法である動的顔レイトランスフィールド(DFRF)を提案する。2Dリファレンス画像に条件付けられた3Dアウェアなレイトランスフィールドと、音声に条件付けられた微分可能顔変形モジュールを用いることで、40kイテレーションで高精細で写真のようにリアルな会話ヘッド動画を生成し、従来のNeRFベース手法に比べて少量学習設定で優れた性能を発揮する。

ABSTRACT

Talking head synthesis is an emerging technology with wide applications in film dubbing, virtual avatars and online education. Recent NeRF-based methods generate more natural talking videos, as they better capture the 3D structural information of faces. However, a specific model needs to be trained for each identity with a large dataset. In this paper, we propose Dynamic Facial Radiance Fields (DFRF) for few-shot talking head synthesis, which can rapidly generalize to an unseen identity with few training data. Different from the existing NeRF-based methods which directly encode the 3D geometry and appearance of a specific person into the network, our DFRF conditions face radiance field on 2D appearance images to learn the face prior. Thus the facial radiance field can be flexibly adjusted to the new identity with few reference images. Additionally, for better modeling of the facial deformations, we propose a differentiable face warping module conditioned on audio signals to deform all reference images to the query space. Extensive experiments show that with only tens of seconds of training clip available, our proposed DFRF can synthesize natural and high-quality audio-driven talking head videos for novel identities with only 40k iterations. We highly recommend readers view our supplementary video for intuitive comparisons. Code is available in https://sstzal.github.io/DFRF/.

研究の動機と目的

  • 既存のNeRFベースの会話ヘッド手法が各アイデンティティごとに大量のデータと再学習を必要としているという制限を解消すること。
  • 最小限のデータで新規アイデンティティへの迅速な適応を可能にし、少量学習設定でも高品質な合成を達成すること。
  • 音声信号に条件付けられた3Dポイントワイズ変形フィールドを学習することで、会話ヘッドアニメーション中の顔の変形モデリングを向上させること。
  • 限られた学習データと短い学習期間でも、高品質な音声・視覚同期と写真のようにリアルなディテールを維持すること。

提案手法

  • ニューラルレイトランスフィールドを2Dリファレンス画像特徴量に条件付け、汎用的な顔の事前分布を学習することで、新規アイデンティティへの迅速な適応を可能にする。
  • 音声に条件付けられた3Dポイントワイズ変形フィールドを用いて、リファレンス画像をクエリ空間に変形する微分可能顔変形モジュールを導入する。
  • 3Dジオメトリと外観は、リファレンス画像特徴量と音声入力を介して動的に調整されるレイトランスフィールドによって暗黙的にモデル化される。
  • 3Dから2Dへの投影メカニズムがリファレンス画像からのピixe情報を取り込み、レンダリングをガイドする。変形処理により会話中の顔の変形を補正する。
  • 少数のリファレンスフレーム(例:15秒のクリップ)を用いてエンドツーエンドで学習し、わずか40kイテレーションで最適化する。
  • フレームワークはゼロショットアイデンティティ一般化とクロスリンガル推論をサポートし、多様な言語や性別においてもリップシンクの正確性を維持する。

実験結果

リサーチクエスチョン

  • RQ12Dリファレンス画像に条件付けられたニューラルレイトランスフィールドは、会話ヘッド合成における新規アイデンティティへの迅速な少量学習適応を効果的に可能にするか?
  • RQ2NeRFベースのフレームワークにおいて、会話中の顔の変形をより良くモデリングすることで、リアリズムと一貫性を向上させられるか?
  • RQ3音声に条件付けられた微分可能変形モジュールは、レンダリング中のリファレンス画像とクエリ空間の整合性を向上させられるか?
  • RQ4極度のデータ不足(例:15秒の学習データ)下で、本手法の視覚的品質と音声・視覚同期性はどのように評価されるか?
  • RQ5異なる言語やスピーカーのアイデンティティ間で一般化可能であり、高精細性と同期性を維持できるか?

主な発見

  • 15秒の学習データと10kイテレーションでのみ、DFRFはNeRFやAD-NeRFよりもはるかにシャープでリアルな会話ヘッド動画を生成する。
  • 少量学習設定(15秒クリップ)において、Test Set AではPSNRが33.28、LPIPSが0.029を達成し、AD-NeRF(33.20、0.032)およびNeRFを上回る性能を示す。
  • Test Set Bでは、PSNRが34.65、LPIPSが0.027を達成し、AD-NeRF(33.85、0.028)を上回り、優れた視覚的品質を示す。
  • 音声・視覚同期性が強く維持されており、Test Set BではSyncNetスコア1/5.755を達成し、正確なリップムーブメントを示している。
  • クロスリンガル設定では、一貫したSyncNetスコア(例:英語ソースで1/5.301、中国語ソースで1/5.755)を達成し、言語や性別を問わず高い耐性を示している。
  • 180秒の学習データでも、[37]や[39]のような非NeRFベースの3D手法を上回り、顔の動きのモデリングにおいて本手法の優位性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。