[論文レビュー] Animatable and Relightable Gaussians for High-fidelity Human Avatar Modeling
本稿では、3Dガウススプラッティングと2D CNNを組み合わせる新規な3Dアバター表現、Animatable Gaussiansを提案する。この手法は、前面・背面のキャノニカルビューにおけるテンプレートガイド付きパrameterizationにより、ポーズ依存の高精細な人間の外見をモデル化する。キャラクター固有のパラメトリックテンプレートを学習し、PCAに基づくポーズ投影を施したStyleGANベースの生成器を用いることで、マルチビューRGB動画から、リアルで動的かつ汎用的なアバターのアニメーションを実現。従来のNeRFベースおよび暗黙的表現手法に比べ、忠実度と推論速度の両面で優れている。
Modeling animatable human avatars from RGB videos is a long-standing and challenging problem. Recent works usually adopt MLP-based neural radiance fields (NeRF) to represent 3D humans, but it remains difficult for pure MLPs to regress pose-dependent garment details. To this end, we introduce Animatable Gaussians, a new avatar representation that leverages powerful 2D CNNs and 3D Gaussian splatting to create high-fidelity avatars. To associate 3D Gaussians with the animatable avatar, we learn a parametric template from the input videos, and then parameterize the template on two front & back canonical Gaussian maps where each pixel represents a 3D Gaussian. The learned template is adaptive to the wearing garments for modeling looser clothes like dresses. Such template-guided 2D parameterization enables us to employ a powerful StyleGAN-based CNN to learn the pose-dependent Gaussian maps for modeling detailed dynamic appearances. Furthermore, we introduce a pose projection strategy for better generalization given novel poses. To tackle the realistic relighting of animatable avatars, we introduce physically-based rendering into the avatar representation for decomposing avatar materials and environment illumination. Overall, our method can create lifelike avatars with dynamic, realistic, generalized and relightable appearances. Experiments show that our method outperforms other state-of-the-art approaches.
研究の動機と目的
- マルチビューRGB動画から、特にドレスのようなゆるい衣装を含む高精細でポーズ依存のアバターをモデル化する課題に対処すること。
- 座標ベースのMLPによるNeRFの限界、特にスペクトルバイアスと低周波数のインダクティブバイアスにより、詳細で動的な外見を捉えることが難しいことへの対処。
- 明示的な3Dガウススプラッティングと強力な2D CNNの組み合わせにより、高視覚的忠実度を実現しつつ、効率的でリアルタイムのアニメーションを可能にすること。
- ポーズ投影戦略を用いて、分布外のポーズ信号を正則化することで、新たなポーズへの一般化を向上させること。
- 2Dネットワーク互換性を保ちつつ、時間的整合性と幾何的忠実度を維持するパrameterizationスキームの開発。
提案手法
- 入力動画からSMPLベースのスキンニングウェイトを用いてキャラクター固有のパラメトリックテンプレートを再構築し、ドレスのようなゆるい衣装の正確なモデル化を可能にする。
- 3Dガウスは、直交投影を介して前面および背面のキャノニカルビューにパrameter化され、各ピクセルが位置、共分散、透過度、色を持つ3Dガウスに対応する2つの2Dガウスマップを形成する。
- StyleUNetベースの条件付き生成器は、テンプレートから導出されたポーズ位置マップを条件として、ポーズ依存のガウスマップを学習する。
- PCAに基づくポーズ投影戦略を導入し、新しいポーズ信号をトレーニング分布空間に投影することで、未観測ポーズに対しても安定的かつ現実的な補間を実現する。
- 最終的なアバターは3Dガウススプラッティングを用いてレンダリングされ、学習済みの2Dマップとポーズ条件付き属性を活用してリアルタイムかつ高品質なレンダリングを実現する。
- 明示的な幾何(ガウス)と強力な2D CNNの統合により、暗黙的表現における座標ベースMLPのインダクティブバイアスを回避する。
実験結果
リサーチクエスチョン
- RQ1明示的な3Dガウススプラッティングと2D CNNの組み合わせが、座標ベースのMLPによるNeRFに比べ、詳細で動的な人間外見のモデル化において優れているか?
- RQ2パラメトリックテンプレートを用いて、長めのドレスのような一般的な衣装を、アニメーション可能で幾何的整合性を保ちつつモデル化できるか?
- RQ32D CNNは、座標ベースのMLPに比べて、ポーズ依存の詳細表現をどの程度向上できるか?
- RQ4PCAに基づくポーズ投影戦略は、視覚的品質の劣化を伴わずに、分布外の新しいポーズに効果的に一般化できるか?
- RQ5提案手法は、高忠実度で動的かつ再ライティング可能なアバターレンダリングを実現しつつ、リアルタイム推論を達成できるか?
主な発見
- 本手法は、特にドレスのようなゆるい衣装において、視覚的忠実度と動的外見モデリングの面で最先端の性能を達成している。SMPLベースのテンプレートでは不十分に扱われる。
- アブレーションスタディにより、キャラクター固有のパラメトリックテンプレートが、非剛体的かつ非コンパクトな衣装において、SMPL-Xに比べて顕著に再構築品質を向上させていることが確認された。
- 2D CNN(StyleUNet)を座標ベースのMLPに置き換えると、ぼやけた、詳細性に欠けるアニメーションが得られ、CNNが微細なポーズ依存外見詳細を捉える優位性を示している。
- PCAに基づくポーズ投影戦略により、アーチファクトが低減され、未観測ポーズの視覚的品質が向上。定性的な結果では、より現実的で一貫性のある3Dガウス構造が得られている。
- 1台のRTX 3090を用いたPyTorch環境で25 FPSの推論速度を達成。TAVA(0.003 FPS)やAvatarReX(TensorRT使用時10 FPS)に比べ顕著に優れている。
- テンプレートガイド付き2Dパラメトリック化と3Dガウススプラッティングの組み合わせにより、多様なポーズにおいて詳細で動的かつ一般化された外見を有する高品質でリアルタイムのレンダリングが実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。