Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compositional Radiance Fields of Dynamic Human Heads

Ziyan Wang, Timur Bagautdinov|arXiv (Cornell University)|Dec 17, 2020
3D Shape Modeling and Analysis参考文献 34被引用数 11
ひとこと要約

本稿では、マルチビュー動画から動的で人間の頭部の高精細かつ視点一貫性のある画像を合成するための構成的レディアンスフィールドフレームワークを提案する。視点依存の外観と幾何学をモデル化するため、3D条件付きデコーダーとリファインメントMLPを備えた分離された潜在空間を用い、新しいシーケンスへの微調整を最小限に抑えつつ、高品質な新視点合成と制御可能な表情アニメーションを実現する。

ABSTRACT

Photorealistic rendering of dynamic humans is an important ability for telepresence systems, virtual shopping, synthetic data generation, and more. Recently, neural rendering methods, which combine techniques from computer graphics and machine learning, have created high-fidelity models of humans and objects. Some of these methods do not produce results with high-enough fidelity for driveable human models (Neural Volumes) whereas others have extremely long rendering times (NeRF). We propose a novel compositional 3D representation that combines the best of previous methods to produce both higher-resolution and faster results. Our representation bridges the gap between discrete and continuous volumetric representations by combining a coarse 3D-structure-aware grid of animation codes with a continuous learned scene function that maps every position and its corresponding local animation code to its view-dependent emitted radiance and local volume density. Differentiable volume rendering is employed to compute photo-realistic novel views of the human head and upper body as well as to train our novel representation end-to-end using only 2D supervision. In addition, we show that the learned dynamic radiance field can be used to synthesize novel unseen expressions based on a global animation code. Our approach achieves state-of-the-art results for synthesizing novel views of dynamic human heads and the upper body.

研究の動機と目的

  • マルチビュー動画から動的で人間の頭部の高精細かつ視点一貫性のある新視点合成を可能にすること。
  • 分離された潜在表現を用いて、動的で表情の変化が激しい顔の複雑な視点依存外観と幾何学をモデル化すること。
  • 潜在空間のサンプリングとキーポイント駆動制御を用いて制御可能なアニメーションを実現すること。
  • 特にエンコーダーのみの微調整を用いて、新しいヘッドシーケンスへの迅速な適応を可能にすること。
  • 表情と視点変動の細かい制御が可能なリアルなレンダリングを実現すること。

提案手法

  • 2次元画像エンコーダーが、平均と分散を伴う256次元の潜在ベクトルに入力画像を回帰し、分離された表現学習を可能にする。
  • 3D条件付きデコーダーが、逆方向3次元畳み込みを用いて、潜在コードから粗いレベルのログ透過度、色、空間特徴量の体積を生成する。
  • リファインメントMLPは3次元座標と空間特徴量を入力とし、細かい透過度と色を予測するが、カメラ方向と視点固有の特徴量を注入することで視点依存性を実現する。
  • 3次元座標に位置エンコーディングを適用することで、誘導的バイアスを向上させ、リファインメントネットワークにおける細部のモデリングを可能にする。
  • 128個の粗いおよび32個の細かい照査ポイントを1本の光線あたりに持つマルチステージのサンプリングスキームを採用し、色、透過度、KL正則化を含むマルチロス目的関数で訓練する。
  • ポイントネット風のキーポイントエンコーダーを用いて、2次元キーポイントシーケンスなどの代替入力モダリティをフレームワークがサポートする。

実験結果

リサーチクエスチョン

  • RQ1構成的レディアンスフィールドモデルは、視点依存外観効果を伴う動的で人間の頭部の高精細な新視点合成を達成できるか?
  • RQ2分離された潜在空間表現は、制御可能な表情アニメーションと補間にどの程度有効か?
  • RQ3最小限の微調整で、新しい顔のアイデンティティにどの程度一般化できるか?
  • RQ4キーポイント駆動制御は、神経的レディアンスフィールドに効果的に統合可能か?
  • RQ5粗いと細かいネットワーク段階の組み合わせは、レンダリング品質と詳細忠実度をどの程度向上させるか?

主な発見

  • モデルは、視点依存外観が現実的で、視点間で一貫性のある幾何学的形状を持つ、動的で人間の頭部の高精細な新視点合成を達成している。
  • 潜在空間のサンプリングにより、追加の学習を必要とせずに自然な表情の遷移が滑らかに実現され、表情の補間が可能である。
  • 新しいシーケンスにおけるエンコーダーのみの微調整により、非微調整ベースラインと比較して、迅速な適応と顕著なレンダリング品質の向上が達成された。
  • モデルは新しいシーケンスに良好に一般化されており、微調整済みバージョンはゼロショットベースラインと比較して滑らかでより正確な結果を生成した。
  • 2次元キーポイントエンコーダーを用いたキーポイント駆動アニメーションは、多様な入力モダリティを効果的に受け入れられる柔軟性を示しており、成功裏に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。