[論文レビュー] Animatable Implicit Neural Representations for Creating Realistic Avatars from Videos
本論文は、キャノニカルなニューラルレイトランスフィールドと、線形ブレンドスキンニングに基づくポーズ駆動型変形フィールドを組み合わせることで、マルチビュー動画からアニメーション可能な3D人体アバターを生成する新規フレームワークを提案する。この手法は、学習可能なブレンドウェイトとスケルトンの運動を用いて、新しいポーズに対する明示的な制御を可能にし、視点合成および3D再構築において最先端の性能を達成している。特に、幾何学的精度を向上させるために符号付き距離関数(SDF)を用いることで、優れた結果を上げている。
This paper addresses the challenge of reconstructing an animatable human model from a multi-view video. Some recent works have proposed to decompose a non-rigidly deforming scene into a canonical neural radiance field and a set of deformation fields that map observation-space points to the canonical space, thereby enabling them to learn the dynamic scene from images. However, they represent the deformation field as translational vector field or SE(3) field, which makes the optimization highly under-constrained. Moreover, these representations cannot be explicitly controlled by input motions. Instead, we introduce a pose-driven deformation field based on the linear blend skinning algorithm, which combines the blend weight field and the 3D human skeleton to produce observation-to-canonical correspondences. Since 3D human skeletons are more observable, they can regularize the learning of the deformation field. Moreover, the pose-driven deformation field can be controlled by input skeletal motions to generate new deformation fields to animate the canonical human model. Experiments show that our approach significantly outperforms recent human modeling methods. The code is available at https://zju3dv.github.io/animatable_nerf/.
研究の動機と目的
- マルチビュー動画から直接再構築することで、アニメーション可能な3D人体モデルの作成コストと複雑さを低減すること。
- 動的NeRFにおける過剰に制約のない最適化問題に対処するため、スケルトンの事前知識を組み込んだポーズ駆動型変形フィールドを導入すること。
- 入力されたスケルトンの運動を用いて、再構築されたモデルの明示的アニメーションを可能にし、ベクトル場やSE(3)フィールド表現の限界を克服すること。
- キャノニカル空間における密度場の代わりに符号付き距離関数(SDF)を用いることで、幾何学的忠実度を向上させること。
提案手法
- 本手法は、動的人体をキャノニカルなニューラルレイトランスフィールドと、観測空間の点をキャノニカル空間に写像するポーズ駆動型変形フィールドに分解する。
- 変形フィールドは線形ブレンドスキンニングを用いて構築され、各3次元点ごとに学習可能なブレンドウェイトをニューラルフィールドとしてモデル化することで、複雑な変形を捉える。
- キャノニカルなニューラルフィールドは、密度/色フィールドまたは符号付き距離関数(SDF)として表現され、SDFはより優れた幾何学的正則化を提供する。
- モデルは、スケルトンのポーズを監視信号として用いて、変形学習を正則化するように、マルチビュー動画シーケンス上でボリュームレンダリングを用いてエンドツーエンドで学習する。
- 代替的手法として、関節運動と非剛性な衣類変形を分離するためのポーズ依存の変位フィールドを用いる。
- 学習済みの変形フィールドに新しいスケルトンポーズを適用することで、新規視点の合成と新規モーションのアニメーションが可能になる。
実験結果
リサーチクエスチョン
- RQ1線形ブレンドスキンニングに基づくポーズ駆動型変形フィールドは、人体モデリングにおける動的NeRFの制御性と正則化を向上させることができるか?
- RQ2アニメーション可能な人体アバターの幾何学的再構築品質において、密度場と比較して符号付き距離関数(SDF)を用いることでどのような差が生じるか?
- RQ3単一視点またはマルチビュー動画シーケンスは、複雑な人体の動きの高品質な再構築とアニメーションをどの程度可能にするか?
- RQ4非剛性変形が顕著な、ゆったりとした服を着たパフォーマーに対しても、本手法は一般化可能か?
- RQ5学習フレーム数と入力視点の数は、視点合成および再構築性能にどのように影響するか?
主な発見
- 本手法は、Human3.6M、ZJU-MoCap、MonoCap、SyntheticHumanの各データセットにおいて、画像合成の分野で最先端の性能を達成している。
- キャノニカル表現に符号付き距離関数(SDF)を用いることで、3D再構築品質が顕著に向上し、特に合成ベンチマークにおいて顕著である。
- 150~300フレームの学習で最適な性能が得られ、300フレームを超えると利得が減少する。
- 単一視点設定でも十分なレンダリング品質が得られており、入力視点が限られている場合の手法の頑健性を示している。
- 800フレームで学習したモデルは、S9被験者においてPSNRが24.48、SSIMが0.895を達成し、長いシーケンスでも安定した性能を示している。
- 細かな衣類のしわを捉える点には限界があるものの、特にタイトな服を着た場合に、複雑な動き下でも妥当な人体形状を効果的に再構築できている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。