Skip to main content
QUICK REVIEW

[論文レビュー] DRWR: A Differentiable Renderer without Rendering for Unsupervised 3D Structure Learning from Silhouette Images

Zhizhong Han, Chao Chen|arXiv (Cornell University)|Jul 12, 2020
Advanced Vision and Imaging参考文献 55被引用数 22
ひとこと要約

DRWRは、レンダリングを伴わない微分可能レンダラを提案し、スクリーンショット画像からの教師なし3次元ポイントクラウド再構成を実現する。滑らかなスクリーンショット損失により3次元ポイントの投影を前面に引き寄せ、構造に配慮した反発損失によりポイントの凝集を防ぐ。ピixe ワイズ補間、可視性処理、シェーディングを排除することで、顕著に高速化されたトレーニングを実現しながら、最先端の精度を達成する。

ABSTRACT

Differentiable renderers have been used successfully for unsupervised 3D structure learning from 2D images because they can bridge the gap between 3D and 2D. To optimize 3D shape parameters, current renderers rely on pixel-wise losses between rendered images of 3D reconstructions and ground truth images from corresponding viewpoints. Hence they require interpolation of the recovered 3D structure at each pixel, visibility handling, and optionally evaluating a shading model. In contrast, here we propose a Differentiable Renderer Without Rendering (DRWR) that omits these steps. DRWR only relies on a simple but effective loss that evaluates how well the projections of reconstructed 3D point clouds cover the ground truth object silhouette. Specifically, DRWR employs a smooth silhouette loss to pull the projection of each individual 3D point inside the object silhouette, and a structure-aware repulsion loss to push each pair of projections that fall inside the silhouette far away from each other. Although we omit surface interpolation, visibility handling, and shading, our results demonstrate that DRWR achieves state-of-the-art accuracies under widely used benchmarks, outperforming previous methods both qualitatively and quantitatively. In addition, our training times are significantly lower due to the simplicity of DRWR.

研究の動機と目的

  • 微分可能レンダラにおけるレンダリングの高コストな計算を軽減すること。
  • ピクセル単位の補間、可視性処理、シェーディングが、スクリーンショットからの正確な3次元再構成に不可欠かどうかを調査すること。
  • レンダリングを回避しながらも、再構成品質を維持または向上させる軽量で微分可能なレンダラを開発すること。
  • 2次元スクリーンショットの教師信号のみを用いて、効率的で頑健な3次元ポイントクラウド再構成のトレーニングを可能にすること。

提案手法

  • DRWRは、従来のピクセル単位の損失に代わり、3次元ポイントの2次元投影に直接作用する投影ベースの損失を採用する。
  • 3次元ポイントの投影が前面に到達するまで非ゼロ勾配を提供する滑らかなスクリーンショット損失を採用し、局所最適解の問題を軽減する。
  • 2点の投影がスクリーンショット内に同時に存在する場合にのみ、構造に配慮した反発損失が、ペアの点を適応的に引き離すことで、カバレッジと分布の改善を図る。
  • 表面補間、可視性処理(例:zバッファリング)、シェーディングを回避することで、レンダリングのオーバーヘッドを排除する。
  • 損失関数は単一項とペair単位の成分を組み合わせており、単一項損失はポイントをスクリーンショットに引き寄せるのに対し、ペア単位損失は前面における空間的分散を強制する。
  • バックプロパゲーションを用いたエンドツーエンドの最適化が行われ、損失の微分可能特性により、3次元ポイントクラウドのパラメータに対する勾配ベースの学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ13次元構造学習は、3次元ポイントの2次元投影に依存するだけで、レンダリングを一切行わずに達成可能か?
  • RQ2ピクセル単位の補間、可視性処理、シェーディングを排除することで、再構成精度は低下するか、あるいは向上するか?
  • RQ3滑らかなスクリーンショット損失は、スクリーンショットベースの3次元再構成における局所最適解の問題を効果的に解消できるか?
  • RQ4投影されたポイント間の構造に配慮した反発が、形状のカバレッジと一般化性をどのように向上させるか?
  • RQ5レンダリングパイプラインを排除した場合、トレーニング効率と再構成精度のトレードオフはどのようなものか?

主な発見

  • DRWRは、標準ベンチマークで最先端の性能を達成し、スクリーンショットからの3次元ポイントクラウド再構成において、定量的・定性的に先行研究を上回る。
  • アブレーションスタディの結果、滑らかなスクリーンショット損失や構造に配慮した反発損失を除去すると、顕著な性能低下が生じ、これらが不可欠であることが確認された。
  • DRWRを用いたトレーニングは、先行する最先端のポイントベースの微分可能レンダラDPCと比較して最大2倍速く、128²解像度、16,000ポイントの再構成において、トレーニング時間が約72時間から約36時間に短縮された。
  • DRWRは実画像にも良好に一般化され、微調整なしにインターネット由来のスクリーンショットから高精細な再構成を生成した。
  • 潜在空間の補間により、DRWRが意味的で連続的な潜在空間を学習しており、学習済み形状間での滑らかな形状補間が可能であることが示された。
  • 構造に配慮した損失関数により、滑らかなスクリーンショット損失と反発損失の衝突が軽減され、収束が速くなり、トレーニング損失が低くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。