[論文レビュー] FLAME-in-NeRF : Neural control of Radiance Fields for Free View Face Animation
FLAME-in-NeRFは、モバイル端末で撮影された動画のみを用いて、顔の表情を明示的かつ分離可能に制御し、ポートレート動画の新規視点合成を可能にする、新しいニューラルレンダリングフィールド手法を提案する。3次元モーファブルモデル(3DMM)の表情パラメータ(γ)でNeRFを条件づけ、3DMMフィッティングから得られる空間的事前知識を適用することで、任意の視点においても高精細な再現性と正確な表情転送を実現し、ベースラインのNeRFに基づく手法を上回る再構成品質と再アニメーション品質を達成する。
This paper presents a neural rendering method for controllable portrait video synthesis. Recent advances in volumetric neural rendering, such as neural radiance fields (NeRF), has enabled the photorealistic novel view synthesis of static scenes with impressive results. However, modeling dynamic and controllable objects as part of a scene with such scene representations is still challenging. In this work, we design a system that enables both novel view synthesis for portrait video, including the human subject and the scene background, and explicit control of the facial expressions through a low-dimensional expression representation. We leverage the expression space of a 3D morphable face model (3DMM) to represent the distribution of human facial expressions, and use it to condition the NeRF volumetric function. Furthermore, we impose a spatial prior brought by 3DMM fitting to guide the network to learn disentangled control for scene appearance and facial actions. We demonstrate the effectiveness of our method on free view synthesis of portrait videos with expression controls. To train a scene, our method only requires a short video of a subject captured by a mobile device.
研究の動機と目的
- 顔の表情を明示的に制御可能な、写真同等の新規視点合成を実現するポートレート動画のための制御可能でリアルな再現手法の開発。
- 動的である人間の顔をアニメートする際、表情と外見が混同する問題に取り組むこと。
- 特別なハードウェアを用いずに、短時間のモバイル端末で撮影された動画から学習可能なシステムの開発。
- 3DMMに基づく空間的事前知識を用いて、顔の外見と表情を分離し、表情の変化が顔関連の幾何構造にのみ影響を与えるように保証すること。
提案手法
- 3次元モーファブルモデル(3DMM)の表情パラメータ(γ)でニューラルレンダリングフィールド(NeRF)を条件づけることで、顔の表情を明示的に制御可能にする。
- 3DMMフィッティングから得られる空間的レイサンプリング事前知識を統合し、ネットワークが表情とシーン外見を分離できるように制約を課す。
- トレーニングの安定性を高めるために、最適化された変形コードを用いたキャノニカルフレームを用意し、動的フレームをキャノニカル幾何構造に一致させる。
- ピクセル単位の再構成損失、知覚的損失、および表情と外見コードに対する正則化を含むマルチコンponent損失を用いてNeRFをトレーニングする。
- ドライビング動画からDECAを用いて表情パラメータを抽出し、その結果をFLAME-in-NeRFの再アニメーション駆動入力として使用する。
- 階層的ボリュームサンプリングとボリュームレンダリングを適用し、トレーニング済みのNeRFから、表情と視点を制御可能な新規視点をレンダリングする。

実験結果
リサーチクエスチョン
- RQ1ニューラルレンダリングフィールドが顔の表情パラメータに明示的に条件づけられることで、制御可能なポートレート動画の再アニメーションが可能になるか?
- RQ23DMMに基づく空間的事前知識の導入が、NeRFにおける顔の表情とシーン外見の分離性をどのように向上させるか?
- RQ3特別な機器を用いずに、短時間のモバイル端末で撮影されたポートレート動画から高精細な新規視点合成と表情制御を達成できるか?
- RQ4標準的なNeRFに基づく手法では、表情と外見の混同が再アニメーション品質をどのように低下させるか、そして効果的に是正できるか?
- RQ5提案手法は、新規視点における表情駆動型再アニメーションにおいて、髪の毛、眼鏡などの細かな顔のディテールをどの程度正確に保持できるか?
主な発見
- FLAME-in-NeRFは、Nerfiesよりも再構成品質および再アニメーション品質の両面で優れており、検証画像においてより低いMSEと高いPSNRを達成した。
- 本手法は、任意の視点方向においても高精細な表情転送を維持しているが、Nerfiesは表情と外見の混同により正しく表情を捉えていない。
- 再アニメーションの結果から、FLAME-in-NeRFはカメラの視点に関係なくドライビング表情を正確に再現しているのに対し、Nerfiesは視点依存の微小な表情変化しか示さない。
- 3DMMフィッティングから得られる空間的事前知識は、顔の外見が表情の変化によって損なわれることを顕著に防ぎ、分離性を著しく向上させた。
- 本システムは、モバイル端末で撮影された短い動画のみを用いても高品質な結果を達成しており、一般ユーザーが撮影可能なデータ収集の可能性を示した。
- 本手法は、顔の細かなディテール(髪、ひげ、歯、眼鏡など)を、顔の表情変化が大きくても高精細に保持している。
![Figure 2 : Overview of training FLAME- in -NeRF. First, we use DECA [ 10 ] and landmark fitting [ 14 ] to extract per-frame camera, shape, and expression parameters. Next, these parameters are used to render a silhouette of the FLAME model geometry. This silhouette is used to provide a spatial prior](https://ar5iv.labs.arxiv.org/html/2108.04913/assets/Figures/method/Method.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。