Skip to main content
QUICK REVIEW

[論文レビュー] Relightable 3D Head Portraits from a Smartphone Video

Artem Sevastopolsky, Savva Ignatiev|arXiv (Cornell University)|Dec 17, 2020
Advanced Vision and Imaging参考文献 41被引用数 8
ひとこと要約

本論文では、交互にフラッシュあり・なしのフレームを含むスマートフォン動画から、再照明可能な3Dヘッドポーチュレートを生成するニューラルレンダリングパイプラインを提示する。構造から運動(SfM)を用いて粗い点群を生成し、深層ネットワークを用いてアルベド、法線、ライティングマップを回帰することで、インタラクティブなフレームレートで任意のライティング条件下での写真同等の再照明が可能になる。顔固有の事前知識を活用することで、アルベドとライティングの分離が安定的に行える。

ABSTRACT

In this work, a system for creating a relightable 3D portrait of a human head is presented. Our neural pipeline operates on a sequence of frames captured by a smartphone camera with the flash blinking (flash-no flash sequence). A coarse point cloud reconstructed via structure-from-motion software and multi-view denoising is then used as a geometric proxy. Afterwards, a deep rendering network is trained to regress dense albedo, normals, and environmental lighting maps for arbitrary new viewpoints. Effectively, the proxy geometry and the rendering network constitute a relightable 3D portrait model, that can be synthesized from an arbitrary viewpoint and under arbitrary lighting, e.g. directional light, point light, or an environment map. The model is fitted to the sequence of frames with human face-specific priors that enforce the plausibility of albedo-lighting decomposition and operates at the interactive frame rate. We evaluate the performance of the method under varying lighting conditions and at the extrapolated viewpoints and compare with existing relighting methods.

研究の動機と目的

  • 低コストでハンドヘルドのスマートフォン動画で撮影された、写真同等の再照明可能な3D人間のヘッドポーチュレートを可能にすること。
  • 単一ビューまたは専用機器に依存する再照明手法の限界を克服するため、フラッシュ・ノーフラッシュ動画シーケンスを入力として用いること。
  • ニューラルレンダリングフレームワーク内で顔固有の事前知識を用いて、アルベドとライティング要因を効果的に分離すること。
  • 学習されたニューラルレンダリングパイプラインを用いて、新しい視点やライティング条件下でリアルタイムの再照明パフォーマンスを達成すること。
  • 方向性光源、点光源、環境マップライティングを含む、任意のライティング条件下での3Dポーチュレートのインタラクティブレンダリングをサポートすること。

提案手法

  • フラッシュあり・なしのフレームを交互に含むスマートフォン動画から、構造から運動(SfM)とマルチビューのノイズ除去を用いて粗い3D点群を再構築する。
  • 各点にニューラル記述子を付加し、その後続のレンダリングに必要な光度的特性を符号化する。
  • 新しい視点における点群のラスタライズド投影から、深層ニューラルレンダリングネットワークがピクセル単位のアルベド、表面法線、シャドウマップを回帰する。
  • L1、TV、対称性、およびVGGベースの知覚的損失を含む多成分損失関数を用いてネットワークを訓練し、幾何的・光度的忠実度を向上させる。
  • 最適化中に顔固有の事前知識を適用し、頭部および上半身全体にわたる現実的なアルベド・ライティング分離を強制する。
  • 最終的なモデルは、学習済みのライティングモデルに新しいライティングパrameterを組み込むことで、任意のライティングに対応でき、インタラクティブなフレームレートでリアルタイムレンダリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1フラッシュ・ノーフラッシュシーケンスを用いた標準的なスマートフォン動画から、再照明可能な3D人間のポーチュレートを再構築できるか?
  • RQ2点群幾何学を用いたニューラルレンダリングは、制約のないライティング条件下でも正確なアルベドとライティングの分解をどの程度可能にするか?
  • RQ3顔固有の事前知識は、ニューラルレンダリングパイプラインにおけるアルベドとライティングの分離をどの程度向上させるか?
  • RQ4本システムは、トレーニング時に見られなかった新しい視点やライティング条件下にも一般化できるか?
  • RQ5主観的品質と正確性の観点から、既存の再照明手法と定量的・定性的に比較して、本手法はどの程度優れているか?

主な発見

  • 環境光 + 1次球面調和関数ライティング下で、合成されたRenderPeopleデータセットにおいてPSNRが259.14、SSIMが0.1259を達成し、両指標でDPR [50]を上回った。
  • アブレーションスタディの結果、法線損失を除いた場合、法線が平均に近づき、より不正確になることが判明。TV損失を除いた場合、アルベド予測がぼやけた結果になる。
  • 対称性損失はシャドウの正確性を向上させる。これを除くと、対称的な顔面特徴部でより現実的でないシャドウが生成される。
  • VGGベースの知覚的損失は色の一致に不可欠である。他の損失を除いてVGGのみを用いた場合、法線の色の一貫性が著しく悪化する。
  • 新しいライティングを元の部屋のライティングに追加した場合に最も良好な性能を示し、追加ライティングのシナリオにおいても堅牢性が確認された。
  • 訓練時に使用されなかった新しい視点に対しても、モデルは良好に一般化するが、極端な視点外挿測では性能がわずかに低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。