Skip to main content
QUICK REVIEW

[論文レビュー] Multiview Neural Surface Reconstruction by Disentangling Geometry and Appearance

Lior Yariv, Yoni Kasten|arXiv (Cornell University)|Mar 22, 2020
Computer Graphics and Visualization Techniques被引用数 345
ひとこと要約

この論文は、マスクされた2D画像の下で異なる照明と材料に対応しながら、幾何学(ニューラルイン implicit surfaceとして)・外観・カメラパラメータを共同学習するエンドツーエンドのニューラルアーキテクチャIDRを提示し、高忠実度のマルチビュー3D再構成を実現します。

ABSTRACT

In this work we address the challenging problem of multiview 3D surface reconstruction. We introduce a neural network architecture that simultaneously learns the unknown geometry, camera parameters, and a neural renderer that approximates the light reflected from the surface towards the camera. The geometry is represented as a zero level-set of a neural network, while the neural renderer, derived from the rendering equation, is capable of (implicitly) modeling a wide set of lighting conditions and materials. We trained our network on real world 2D images of objects with different material properties, lighting conditions, and noisy camera initializations from the DTU MVS dataset. We found our model to produce state of the art 3D surface reconstructions with high fidelity, resolution and detail.

研究の動機と目的

  • 追加の監督なしで、粗いまたは未知のカメラ姿勢を持つマスクされた2D画像から3D幾何を再構成する。
  • 幾何をニューラルのゼロレベルセット(SDF)として表現し、照明変化下での外観のためのニューラルレンダラを学習する。
  • 表面法線と視線方向でレンダラを条件付けすることで、幾何と外観の分離を可能にする。
  • レンダリングを通知するためのグローバル幾何特徴ベクトルを導入して、グローバル照明効果を扱う。

提案手法

  • 幾何をニューラルネットワーク f のゼロレベルセットとして表現し、符号付き距離関数(SDF)として解釈する。
  • 表面点、法線、視線方向、およびグローバル幾何特徴ベクトルの関数として表面光場をモデル化する、差分可能な暗黙レンダラ M を用いる。
  • 差分可能な前方モデル Lp(θ,γ,τ)=M(x̂p, n̂p, ẑp, vp; γ) を介してピクセルカラーを計算し、θ(幾何)、γ(外観)、τ(カメラ)をエンドツーエンドで学習する。
  • 最適化のために正確な一階微分挙動を保持するニューラル統一表現を用いて、レイと表面の差分可能な交点 X̂(θ,τ) を取り入れる。
  • 二値セグメンテーションを活用するマスクベースの損失と、妥当な表面を促す暗黙の幾何正則化(IGR)を用いる。
  • 間接照明とシーン全体の効果を捉えるために、高周波入力マップとグローバル特徴ベクトルをレンダラに付加する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの微分可能なパイプラインは、マスクされた2D画像から幾何、外観、カメラパラメータを共同で回復できるか。
  • RQ2表面法線と視線方向を組み込んだニューラルレンダラは、多様な材料と照明下で幾何と外観を分離することができるか。
  • RQ3グローバル照明効果と近接場相互作用は、マルチビュー表面再構成の質にどの程度影響を与えるか。
  • RQ4カメラが既知または共同学習された場合、IDRは標準のマルチビューデータセットのベースラインとどのように比較されるか。

主な発見

  • IDRは、DTU MVSデータセットにおいて、固定カメラ設定と学習カメラ設定の両方で、Chamfer distanceとPSNRの点で最先端または競合的な3D表面再構成を達成する。
  • 表面法線をニューラルレンダラに組み込むことは、幾何–外観の適切な分離に必要であり、幾何忠実度とレンダリング品質を向上させる。
  • モデルは watertight な表面を再構成しつつカメラ推定を改善でき、未知カメラ条件下で Fountain データセットのカメラ精度でベースラインを上回る。
  • アブレーションにより、視線方向、法線、またはグローバル特徴ベクトルを削除すると再構成品質が低下し、正確なレンダリングと幾何のためには各成分が重要であることを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。