Skip to main content
QUICK REVIEW

[論文レビュー] ShapeFit and ShapeKick for Robust, Scalable Structure from Motion

Thomas Goldstein, Paul Hand|arXiv (Cornell University)|Aug 7, 2016
Advanced Vision and Imaging参考文献 24被引用数 8
ひとこと要約

本稿では、敵対的外れ値が存在する状況下でも、破損した一対の方向ベクトルからカメラ位置を正確に回復できる、ロバストでスケーラブルな構造からモーション(SfM)のための凸最適化に基づくShapeFitとShapeKickを紹介する。この手法は、先行手法と比較して10倍の高速化を達成しながら、最先端の再構成精度を実現し、証明可能な回復保証と効率的な数値実装を提供する。

ABSTRACT

We introduce a new method for location recovery from pair-wise directions that leverages an efficient convex program that comes with exact recovery guarantees, even in the presence of adversarial outliers. When pairwise directions represent scaled relative positions between pairs of views (estimated for instance with epipolar geometry) our method can be used for location recovery, that is the determination of relative pose up to a single unknown scale. For this task, our method yields performance comparable to the state-of-the-art with an order of magnitude speed-up. Our proposed numerical framework is flexible in that it accommodates other approaches to location recovery and can be used to speed up other methods. These properties are demonstrated by extensively testing against state-of-the-art methods for location recovery on 13 large, irregular collections of images of real scenes in addition to simulated data with ground truth.

研究の動機と目的

  • 対応誤差が生じる状況下でも、一対の相対的向きからグローバルなカメラ位置を回復するという、構造からモーションパイプラインにおける主要なボトル neck を解決すること。
  • 誤差分布の統計的仮定に依存せずに、繰り返し構造が見られる人工構造物で一般的に発生する重大な外れ値に対してロバストである手法を開発すること。
  • 一対の相対的向きの大部分が破損している場合でも、カメラ位置の正確な回復を保証する凸最適化フレームワークを設計すること。
  • 高い計算効率とスケーラビリティを実現し、大規模な画像コレクションにおいてリアルタイムまたはニアリアルタイムの性能を達成すること。
  • 他の構造からモーション手法の高速化を可能にする柔軟な数値フレームワークを提供し、既存のパイプラインと統合可能であること。

提案手法

  • ShapeFitは、観測された相対的向きと推定された相対的向きの残差のL1ノルムを最小化する凸最適化プログラムとして位置回復問題を定式化し、敵対的破損下でも正確な回復を可能にする。
  • この手法は、半正定値緩和と低ランク行列回復フレームワークを活用し、一対の相対的向きからカメラ位置を推定する。特定の条件下で正確な回復が保証される理論的根拠を有する。
  • ShapeKickは、ShapeFitの高速で一次のアルゴリズム実装であり、加速された近接勾配法を用いて、先行手法と比較して10倍の高速化を達成している。
  • フレームワークは1次元SfM(1dSfM)とLUDを用いた外れ値フィルタリングを統合し、ロバスト性を向上させることができ、他の手法と組み合わせて全体の性能を向上させることができる。
  • 既知のカメラ回転を用いて回転をアンカリングする定式化を採用し、変位推定問題を凸計画問題に簡略化することで、計算の安定性を向上させている。
  • モジュラーかつ合成可能な設計となっており、既存のSfMパイプラインへの統合が可能で、さまざまな初期相対姿勢推定器と互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1凸最適化アプローチは、一対の相対的向きの大部分が敵対的に破損している状況下でも、カメラ位置の正確な回復を達成できるか?
  • RQ2正確性やロバスト性を損なわず、ロバストな位置回復の計算効率をどのように向上させられるか?
  • RQ3現実世界のシーンにおける繰り返し構造や光度的曖昧さによって生じる重大な外れ値が存在する状況下でも、証明可能な回復保証をどの程度維持できるか?
  • RQ4大規模で不規則な画像コレクションにおいて、ShapeFitとShapeKickの再構成誤差と実行時間は、最先端の手法と比べてどの程度の性能を示すか?
  • RQ5提案されたフレームワークは、他の構造からモーションアルゴリズムの高速化に利用可能か?また、既存の外れ値フィルタリング技術とどのように相互作用するか?

主な発見

  • ShapeFitは、部分的に破損した一対の相対的向きからカメラ位置を正確に回復でき、敵対的破損下でも理論的保証を有する。
  • ShapeFitの高速で一次の実装であるShapeKickは、先行手法と比較して少なくとも10倍速く、再構成精度は同等を維持している。
  • 13の大きな実世界データセットにおいて、ShapeFitとShapeKickは、最高の既存手法と同等の中央値再構成誤差を達成したが、LUDは平均誤差は低く、中央値誤差は高かった。
  • 1dSfMによる外れ値フィルタリングは、ShapeFitとLUDのロバスト性を向上させ、ローマ・フォーラムやノートルダム寺院のようなデータセットで回復誤差を2〜10倍まで低減した。
  • 本手法は、光度的曖昧さや繰り返し構造といった、人工構造物における対応失敗の主な要因に対してロバストであり、実世界のSfMパイプラインにおける実用的価値を示している。
  • フレームワークは非常にスケーラブルかつ効率的であり、特にピカデリー(826枚)やヴィエニス・カテドラル(826枚)のような大規模データセットでは、非凸的かつ非ロバストな代替手法と比較して、実行時間性能が顕著に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。