Skip to main content
QUICK REVIEW

[論文レビュー] Deep Shape-from-Template: Wide-Baseline, Dense and Fast Registration and Deformable Reconstruction from a Single Image

David Fuentes-Jiménez, David Casillas-Pérez|arXiv (Cornell University)|Nov 19, 2018
Advanced Vision and Imaging参考文献 65被引用数 6
ひとこと要約

本論文は、3次元テンプレートを用いて1枚の画像から密実時間3次元再構成および登録を実現する深層学習フレームワーク、DeepSfTを提案する。従来の手法の限界を克服し、広視差領域での動作、一般化可能なテンプレート処理、実データを用いた半教師付き学習、カメラに依存しない推論を可能にし、遮蔽、ぼやけ、テクスチャの変動といった困難な条件下でも最先端の精度を達成する。

ABSTRACT

We present Deep Shape-from-Template (DeepSfT), a novel Deep Neural Network (DNN) method for solving real-time automatic registration and 3D reconstruction of a deformable object viewed in a single monocular image.DeepSfT advances the state-of-the-art in various aspects. Compared to existing DNN SfT methods, it is the first fully convolutional real-time approach that handles an arbitrary object geometry, topology and surface representation. It also does not require ground truth registration with real data and scales well to very complex object models with large numbers of elements. Compared to previous non-DNN SfT methods, it does not involve numerical optimization at run-time, and is a dense, wide-baseline solution that does not demand, and does not suffer from, feature-based matching. It is able to process a single image with significant deformation and viewpoint changes, and handles well the core challenges of occlusions, weak texture and blur. DeepSfT is based on residual encoder-decoder structures and refining blocks. It is trained end-to-end with a novel combination of supervised learning from simulated renderings of the object model and semi-supervised automatic fine-tuning using real data captured with a standard RGB-D camera. The cameras used for fine-tuning and run-time can be different, making DeepSfT practical for real-world use. We show that DeepSfT significantly outperforms state-of-the-art wide-baseline approaches for non-trivial templates, with quantitative and qualitative evaluation.

研究の動機と目的

  • 複雑で非平面的で弱いテクスチャを持つテンプレートを対象とする、密実時間的で広視差領域をカバーする変形物体のShape-from-Template(SfT)の長年の課題に取り組む。
  • 従来のDNNベースのSfT手法が要求する規則的なテンプレート、合成データのみの学習、カメラ固有の展開という制限を克服する。
  • ぼやけ、照明の変化、部分的遮蔽といった実世界の撮影条件においても、頑健な性能を発揮することを可能にする。
  • 物理学的制約(準等長性)を深層学習と統合することで、一般化性能と精度を向上させる。
  • 合成データと実データの組み合わせによる半教師付き学習パラダイムを構築し、完全な教師付きデータがなくてもシミュレーションから実世界へのギャップを埋める。

提案手法

  • 任意の複雑なテンプレートに一般化可能な、3次元テンプレートを学習重みに直接埋め込んだ深層ニューラルネットワークであるDeepSfTを提案し、アーキテクチャの再トレーニングなしに実現する。
  • 合成データと実画像を組み合わせた半教師付き学習手順を設計し、登録の精度を向上させ、シミュレーションから実世界へのドメインギャップを低減するための登録リファインメントブロックを活用する。
  • 入力画像を標準化されたカメラフレームに正規化するジオメトリ変換モジュールを導入し、再トレーニングなしに異なるカメラに展開可能にする。
  • 微分可能レンダリングと光度損失を組み合わせて、登録と再構成をエンドツーエンドで監視するとともに、準等長性変形制約を強制する。
  • 2段階の推論パイプラインを採用:まず粗い変形パラメータを予測し、その後、密な画像ブレンドを用いて登録リファインメントブロックでそれを精緻化する。
  • 耐障害性の高い画像特徴を抽出するためのマルチスケール特徴抽出バックボーン(ResNet-50)を用い、その後にデコーダヘッドを配置して密な3次元変形場を予測する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、一般化された非平面的で弱いテクスチャを持つテンプレートを対象とし、広視差領域の条件下で1枚の画像から密実時間3次元再構成および登録を達成できるか?
  • RQ2学習データが合成画像に限定され、実データがわずかにしか利用できない状況において、半教師付き学習は一般化性能をどのように向上させるか?
  • RQ3ジオメトリ変換モジュールは、再トレーニングなしに異なる撮影環境にわたるカメラに依存しない推論をどの程度可能にするか?
  • RQ4微分可能レンダリングと物理学的変形事前知識(準等長性)を組み合わせることで、完全に学習ベースの手法よりも高い精度と頑健性が得られるか?
  • RQ5提案手法は、困難な実世界の条件下において、非DNNベースのSfT手法および従来のDNNベースのSfT手法を上回る精度、速度、頑健性を達成できるか?

主な発見

  • DS3データセットでは平均3次元再構成誤差が5.52 mm、DS4では4.76 mmを達成し、微調整後でさえDenseDepth や BTS といった最先端の単眼深度推定手法を大きく上回る。
  • 単一のNVIDIA GTX-1080 GPUで20.40 fpsで実行可能であり、実時間推論を実現している。一方、CH17 や NGO15 といった他のDNNベースの手法は、100倍以上も遅い。
  • 実データを用いた半教師付き学習により、シミュレーションから実世界へのギャップが低減され、DS5データセットでは光度誤差が最大55%(0.380から0.345に)改善された。
  • 登録リファインメントブロックにより、DS2では光度誤差が83%(0.090から0.015に)減少し、密な対応関係の精度向上が顕著に示された。
  • DeepSfTは、ぼやけ、照明の変化、部分的遮蔽といった困難な条件下でも、誤差を低く維持する。一方、従来の手法は著しく失敗する。
  • DS1〜DS5でテストした全データセットで最先端の性能を達成した。非平面的で弱いテクスチャを持つオブジェクト(例えば、トカゲのぬいぐるみや靴)に対しても、従来の手法がうまくいかない状況でも効果的に対処できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。