Skip to main content
QUICK REVIEW

[論文レビュー] HumanNeRF: Free-viewpoint Rendering of Moving People from Monocular Video

Chung-Yi Weng, Brian Curless|arXiv (Cornell University)|Jan 11, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

HumanNeRF は、1枚の単眼動画から、キャノニカルな T ポーズのボリュメトリック表現と、それらをバックワードワープによって各フレームにマップする動き場を学習することで、移動中の人物の自由視点レンダリングを可能にする。本手法は、定量的指標および視覚的品質の両面で最先端の結果を達成しており、特に衣服のしわや新しい視点での顔貌の細部を捉える点で優れている。

ABSTRACT

We introduce a free-viewpoint rendering method -- HumanNeRF -- that works on a given monocular video of a human performing complex body motions, e.g. a video from YouTube. Our method enables pausing the video at any frame and rendering the subject from arbitrary new camera viewpoints or even a full 360-degree camera path for that particular frame and body pose. This task is particularly challenging, as it requires synthesizing photorealistic details of the body, as seen from various camera angles that may not exist in the input video, as well as synthesizing fine details such as cloth folds and facial appearance. Our method optimizes for a volumetric representation of the person in a canonical T-pose, in concert with a motion field that maps the estimated canonical representation to every frame of the video via backward warps. The motion field is decomposed into skeletal rigid and non-rigid motions, produced by deep networks. We show significant performance improvements over prior work, and compelling examples of free-viewpoint renderings from monocular video of moving humans in challenging uncontrolled capture scenarios.

研究の動機と目的

  • 制御されていない現実世界の環境でも、1枚の単眼動画から移動中の人物の自由視点レンダリングを可能にすること。
  • 複数視点入力、制御されたラボ環境、または SMPL ベースのテンプレートを必要とする先行手法の制限を克服すること。
  • 正確な幾何学、テクスチャ、および衣類のしわや顔貌の動的詳細を含む高精細な新規ビューを合成すること。
  • 事前に定義されたボディモデルや手動での3D監視に依存せずに、動画からエンドツーエンドにキャノニカルな人体外観と動き場を学習すること。
  • YouTube や自撮り動画を含む多様で困難な屋外動画においても、頑健な性能を発揮すること。

提案手法

  • 本手法は、各フレームのセグメンテーションと3Dポーズ推定を伴う単眼動画から、T ポーズにおける人体のキャノニカルボリュメトリック表現を最適化して学習する。
  • バックワードワープを用いて、キャノニカルボリュームを各フレームにマップする動き場を学習し、骨格の剛体成分と非剛体成分に分解する。
  • 動き場は深層ニューラルネットワークによって表現され、ボリュメトリックオフセットを予測する。剛体(骨格)と非剛体(変形可能)の動きには別々のネットワークを用いる。
  • セグメンテーションマスクに基づき、前面ピクセルを優先する重要度サンプリングを用いて、キャノニカルボリュームと動き場をエンドツーエンドで訓練する。
  • 任意のカメラアングルから一時停止したフレームから新規ビューを合成するため、マルチスケール NeRF ベースのレンダラを用いる。
  • 微分可能レンダリングパイプラインを採用し、L1 損失と感知的損失(LPIPS)を用い、最適化の安定化を図るための重み初期化を慎重に設定する。

実験結果

リサーチクエスチョン

  • RQ11枚の移動中の人物の単眼動画から、任意のカメラアングルからの写実的な新規ビューを合成できるか?
  • RQ2SMPL やその他のパrametricなボディモデルに依存せずに、キャノニカルなボリュメトリック表現を学習できるか?
  • RQ3学習された動き場は、複雑な動きにおける衣類や髪の動きのような大規模な非剛体変形をどれほど正確に捉えられるか?
  • RQ4YouTube や自撮りクリップなどの制御されていない屋外動画にも一般化できるか?
  • RQ5シーケンス長とポーズの多様性が再構築品質に与える影響は何か?

主な発見

  • ZJU-MoCap データセットにおいて、HumanNeRF は被験者 390 で PSNR 30.52、SSIM 0.9682、LPIPS 33.88 を達成し、すべての指標で NeuralBody を上回った。
  • 同じデータセットで、被験者 390 における LPIPS スコアが 33.88 と、NeuralBody の 52.12 より顕著に低く、より優れた感知的品質を示した。
  • 同じデータセットで、被験者 313 では PSNR 29.421、SSIM 0.9672 を達成し、NeuralBody の 29.417 と 0.9635 を上回った。
  • シーケンス長のアブレーションでは、112 フレームを超えると性能が頭打つ(PSNR 31.01)ことが示され、ポーズの多様性がフレーム数よりも重要であることがわかった。
  • 視覚的比較では、HumanNeRF は未確認の視点で衣類のしわや顔貌の特徴を正確に捉えている一方、NeuralBody はぼやけた結果を出力した。
  • 図 18 に示すように、本手法は自撮り動画や YouTube クリップに対してもキャノニカルな外観を成功裏に再構築でき、実世界データへの一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。