Skip to main content
QUICK REVIEW

[論文レビュー] DIST: Rendering Deep Implicit Signed Distance Function with Differentiable Sphere Tracing

Shaohui Liu, Yinda Zhang|arXiv (Cornell University)|Nov 29, 2019
3D Shape Modeling and Analysis参考文献 41被引用数 19
ひとこと要約

本稿では、ニューラルネットワークとして表現された深層暗黙的符号付き距離関数(SDF)のための微分可能球トレーシングレンダラーであるDISTを提案する。前向きおよび後向きの両方のパスを最適化することで、マルチビュー画像や深度マップなどの2次元観測からの効率的でメモリ効率の良い3次元形状再構成を可能にし、ファインチューニングを必要とせずに最先端の一般化性能と耐障害性を達成する。

ABSTRACT

We propose a differentiable sphere tracing algorithm to bridge the gap between inverse graphics methods and the recently proposed deep learning based implicit signed distance function. Due to the nature of the implicit function, the rendering process requires tremendous function queries, which is particularly problematic when the function is represented as a neural network. We optimize both the forward and backward passes of our rendering layer to make it run efficiently with affordable memory consumption on a commodity graphics card. Our rendering method is fully differentiable such that losses can be directly computed on the rendered 2D observations, and the gradients can be propagated backwards to optimize the 3D geometry. We show that our rendering method can effectively reconstruct accurate 3D shapes from various inputs, such as sparse depth and multi-view images, through inverse optimization. With the geometry based reasoning, our 3D shape prediction methods show excellent generalization capability and robustness against various noises.

研究の動機と目的

  • 逆画像処理と深層学習ベースの暗黙的SDF表現の間のギャップを埋めるために、微分可能レンダリングを可能にする。
  • 連続的SDFにおける微分可能レンダリングの計算およびメモリの課題に取り組む。これは、レイマーチング中に膨大な数の関数クエリを必要とするためである。
  • 学習済み潜在空間における幾何的推論を用いて、スパースまたは部分的な2次元観測(例:深度マップ、マルチビュー画像)からの正確な3次元形状再構成を可能にする。
  • 従来の学習ベースまたはメッシュベースの手法と比較して、ノイズ、ドメインシフト、初期化の質の悪さに対する一般化性能と耐障害性を向上させる。

提案手法

  • コアレンダリングアルゴリズムとして球トレーシングを採用し、各ピクセルからレイを進めて符号付き距離値がゼロ(表面ヒット)に達するまでマーチングする。
  • 前向きパスにおいて粗いから細かい段階へのレイマーチング戦略を導入することで、初期計算を削減し、冗長なクエリを回避する。
  • 安全な収束基準を用いた能動的なレイマーチングステップを採用し、解像度を維持しながらクエリ数を最小限に抑える。
  • 後向きパスで勾配の近似法を提案し、訓練性能にほとんど影響を与えることなく、メモリと計算量を大幅に削減する。
  • 事前学習済みのDeepSDFジェネレータと微分可能レンダラーを統合し、逆画像処理によりレンダリング済みと観測済み2次元画像間の損失を最小化する潜在コードを最適化する。
  • 深度マップ、表面法線、シルエット、複数ビュー間の光度的一致性など、さまざまな2次元監視信号をサポートする。

実験結果

リサーチクエスチョン

  • RQ1コンsumerハードウェア上で、禁止的なメモリまたは計算コストを伴わずに、ニューラル暗黙的SDFのための微分可能球トレーシングを効率的に実装できるか?
  • RQ2微分可能レンダリングによる幾何的推論は、データセット間での一般化性能を向上させるとともに、ノイズやスパースな入力下でも3次元形状再構成の性能を向上させられるか?
  • RQ3精度と耐障害性の観点から、メッシュベースまたは完全に学習ベースの手法と比較して、微分可能SDFレンダリングの性能はどの程度か?
  • RQ4初期潜在コードがランダムに設定されたり、カメラパラメータが学習分布から逸脱した場合でも、この手法はどの程度有効に保たれるか?

主な発見

  • 提案された微分可能レンダラーは、ファインチューニングを行わずともPMO合成テストセットで最先端の3次元形状再構成精度を達成し、PMOと同等の性能を示した。
  • 未知のカメラ焦点距離に対して、PMOよりも顕著に優れた一般化性能を示し、最小限の性能低下で安定した性能を維持した。一方、PMOはドメインシフトと過学習の影響を強く受けた。
  • ランダムな潜在コードやノイズの強い初期化から始めても、本手法は高い再構成品質を維持したが、PMOは同様の条件下で性能が著しく低下した。
  • 実世界のマルチビューデータセットにおいて、DISTはPMOよりもより正確で構造的に整合性のある3次元形状を生成した。PMOはしばしば細部の回復やトポロジーの修正に失敗した。
  • 後向きパスにおける勾配近似により、訓練にほとんど影響を与えることなく、メモリと計算量が大幅に削減され、コンsumer GPU上での効率的な最適化が可能になった。
  • 本手法は強力な幾何的推論を可能にした:高品質な3次元再構成がランダム初期化からも達成可能であり、教師ありファインチューニングを超えた耐障害性と一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。