[論文レビュー] Animatable Neural Radiance Fields from Monocular RGB Video
本論文では、ポーズ誘導型変形を用いたキャノニカル空間の学習とトレーニング中のポーズ推定の精錬を通じて、単眼RGB動画から高精細な人間アバターを生成するアニメーション可能なニューラルレイトランスフィールドを提案する。本手法により、任意のポーズにおける詳細なパースペクティブ一貫性のあるレンダリングと、写真のようにリアルなアニメーションが可能になる。
We present animatable neural radiance fields for detailed human avatar creation from monocular videos. Our approach extends neural radiance fields (NeRF) to the dynamic scenes with human movements via introducing explicit pose-guided deformation while learning the scene representation network. In particular, we estimate the human pose for each frame and learn a constant canonical space for the detailed human template, which enables natural shape deformation from the observation space to the canonical space under the explicit control of the pose parameters. To compensate for inaccurate pose estimation, we introduce the pose refinement strategy that updates the initial pose during the learning process, which not only helps to learn more accurate human reconstruction but also accelerates the convergence. In experiments we show that the proposed approach achieves 1) implicit human geometry and appearance reconstruction with high-quality details, 2) photo-realistic rendering of the human from arbitrary views, and 3) animation of the human with arbitrary poses.
研究の動機と目的
- 単一のRGB動画ストリームから詳細で写真的リアリズムの高い人間アバター再構築を可能にすること。
- マルチビューの監視なしにニューラルレイトランスフィールドにおける動的で人間のジオメトリと外観のモデリングの課題に対処すること。
- 学習されたキャノニカル空間を用いて任意のポーズでの制御可能なアニメーションを実現すること。
- 最適化中に初期ポーズ推定を精錬することで、再構築の正確性とトレーニング収束の向上を図ること。
提案手法
- 本手法は、観測空間からキャノニカル空間への明示的なポーズ誘導型変形を可能にする人間テンプレート用のキャノニカル空間を導入する。
- フレームごとの人間ポーズを推定し、そのパrameterをニューラルレイトランスフィールドネットワーク内の変形を誘導するために使用する。
- 初期ポーズ推定をトレーニング中に更新するポーズ精錬戦略を採用し、不正確さを是正し、再構築品質を向上させる。
- シーン表現ネットワークはキャノニカル空間でジオメトリと外観を学習し、ポーズ間で細部を保持する。
- 本手法は、単眼入力からの複雑な人間の形状とテクスチャをモデル化するため、暗黙的ニューラル表現を活用する。
実験結果
リサーチクエスチョン
- RQ1単眼RGB動画のみを用いて、ニューラルレイトランスフィールドを動的で人間のシーンに拡張できるか?
- RQ2マルチビューの監視なしに、単一の動画ストリームから正確な人間のジオメトリと外観を再構築できるか?
- RQ3キャノニカル空間におけるポーズ誘導型変形は、任意のポーズでの高精細なアニメーションを可能にするか?
- RQ4トレーニング中にポーズを精錬することで、再構築品質と収束速度にどの程度の向上が得られるか?
主な発見
- 本手法は、単眼動画からの高品質な、暗黙的再構築を実現し、細部まで正確に再現する。
- 写真的リアリズムのレンダリングが、挑戦的な照明やポーズ条件下でも任意の新規ビューから実現される。
- 本システムは、入力動画に存在しないポーズを含む、自然な人間アバターのアニメーションを可能にする。
- トレーニング中のポーズ精錬により、固定ポーズ入力と比較して再構築の正確性が向上し、収束速度が速くなる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。