[論文レビュー] DeepSFM: Structure From Motion Via Deep Bundle Adjustment
DeepSFMは、写真的一致性および幾何的一致性を強制する深層学習フレームワークを提案する。2つの微分可能コストボリューム(D-CVとP-CV)を用いて、反復的に3次元深度とカメラポーズを最適化する。本手法は、ノイズが多いまたはスパarsな初期ポーズや深度推定に対しても優れた耐性を示し、最先端の性能を達成する。
Structure from motion (SfM) is an essential computer vision problem which has not been well handled by deep learning. One of the promising trends is to apply explicit structural constraint, e.g. 3D cost volume, into the network. However, existing methods usually assume accurate camera poses either from GT or other methods, which is unrealistic in practice. In this work, we design a physical driven architecture, namely DeepSFM, inspired by traditional Bundle Adjustment (BA), which consists of two cost volume based architectures for depth and pose estimation respectively, iteratively running to improve both. The explicit constraints on both depth (structure) and pose (motion), when combined with the learning components, bring the merit from both traditional BA and emerging deep learning technology. Extensive experiments on various datasets show that our model achieves the state-of-the-art performance on both depth and pose estimation with superior robustness against less number of inputs and the noise in initialization.
研究の動機と目的
- 深層学習ベースのSfM手法が明示的な幾何的制約を欠き、正確な初期カメラポーズに依存するという限界を解消すること。
- 従来のSfMがテクスチャが乏しいまたは非ラムベールトなシーンで脆くなるのを、物理的事前知識を深層学習フレームワークに統合することで克服すること。
- バンドル調整の反復的性質を模倣することで、初期推定値がノイズが多いまたはスパarsであっても、深度とカメラポーズの両方を安定して最適化できること。
- 伝統的な幾何的SfMとエンドツーエンドの深層学習の間のギャップを埋め、学習可能な反復的アーキテクチャに写真的一致性と幾何的一致性を統合すること。
提案手法
- バンドル調整を模倣した物理的駆動型深層ネットワークを提案し、2つの異なる微分可能コストボリューム(D-CVとP-CV)を用いる。D-CVは深度推定に、P-CVはポーズ最適化に使用される。
- D-CVは、ピクセルを離散的な深度平面に再投影し、複数視点間での画像特徴および深度値の差を測定することで、写真的一致性および幾何的一致性のコストを計算する。
- P-CVは同様のコスト計算を実行するが、仮想的なカメラの移動を想定して行い、写真的一致性および幾何的一致性の差を測定することでポーズを最適化する。
- ネットワークはD-CVとP-CVの推論を交互に繰り返すことで反復的最適化ステップを実行し、座標降下法に類似した方法で深度とポーズ推定を改善する。
- 初期深度は従来の3次元コストボリュームから得られ、初期ポーズはDeMoNのような直接回帰モデルから導出され、弱い教師信号からのエンドツーエンド学習を可能にする。
- 反復的プロセスにより、LM最適化のアンラップにおけるメモリおよび計算のボトル neck を回避でき、従来の手法よりも多くの反復回数を実行でき、収束性が向上する。
実験結果
リサーチクエスチョン
- RQ1深層学習フレームワークが、写真的一致性および幾何的一致性といった明示的な幾何的制約を、深度とポーズの共同最適化に効果的に統合できるか。
- RQ2初期カメラポーズがノイズが多いまたは不正確な場合、深層学習ベースのSfM手法は従来のバンドル調整と比べてどの程度性能を発揮するか。
- RQ3D-CVとP-CVによる反復的最適化が、1回の順伝播を超えて深度とポーズ推定をどの程度向上できるか。
- RQ4入力ビュー数が減少した場合や、入力ポーズにノイズが加わった場合、本手法がどの程度の耐性を示すか。
- RQ5微分可能アーキテクチャに物理的事前知識を統合することで、エンドツーエンド回帰ベースのSfMモデルに比べ、一般化性能および精度で優れた性能を発揮できるか。
主な発見
- DeepSFMはDeMoN、ScanNet、ETH3D、Tanks and Templesの各データセットで最先端の性能を達成し、従来のSfM(例:COLMAP)および最先端の深層学習手法を上回る。
- ETH3Dでは、同じ入力ビュー数のもとでCOLMAPと比較して深度誤差を半減させ、あるいは半分の入力画像数で同等の誤差を達成した。
- 画像のダウンスケーリングやフレームのサブサンプリングによって入力ポーズの品質が低下しても、DeepSFMは安定した性能を維持するが、COLMAPやR-MVSNetは顕著な性能低下を示した。
- 反復的最適化プロセスは約4反復で収束し、深度誤差とポーズ誤差の両方が一貫して減少し、相互に改善が見られた。
- アブレーションスタディでは、P-CVモジュールが直接視覚オドメトリのベースラインと比較して、特に初期段階でノイズの多い深度推定下でもポーズ推定を著しく向上させた。
- カメラ軌道および3次元再構築の可視化結果から、テクスチャが乏しいまたは反射的な表面を有する困難なシーンでも、より高品質で安定した出力を得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。