Skip to main content
QUICK REVIEW

[論文レビュー] Learning Feature Descriptors using Camera Pose Supervision

Qianqian Wang, Xiaowei Zhou|arXiv (Cornell University)|Apr 28, 2020
Robotics and Sensor-Based Localization参考文献 70被引用数 4
ひとこと要約

本論文は、ピクセル単位の正例対応情報が不要な相対カメラポーズのみを監視信号として用いる弱教師付きフレームワークCAPSを提案する。エピポーラ制約と微分可能でコarse-to-fineなマッチング層を活用することで、CAPSは幾何的タスクにおいて最先端の性能を達成し、完全教師あり手法を上回る結果を示した。

ABSTRACT

Recent research on learned visual descriptors has shown promising improvements in correspondence estimation, a key component of many 3D vision tasks. However, existing descriptor learning frameworks typically require ground-truth correspondences between feature points for training, which are challenging to acquire at scale. In this paper we propose a novel weakly-supervised framework that can learn feature descriptors solely from relative camera poses between images. To do so, we devise both a new loss function that exploits the epipolar constraint given by camera poses, and a new model architecture that makes the whole pipeline differentiable and efficient. Because we no longer need pixel-level ground-truth correspondences, our framework opens up the possibility of training on much larger and more diverse datasets for better and unbiased descriptors. We call the resulting descriptors CAmera Pose Supervised, or CAPS, descriptors. Though trained with weak supervision, CAPS descriptors outperform even prior fully-supervised descriptors and achieve state-of-the-art performance on a variety of geometric tasks. Project Page: https://qianqianwang68.github.io/CAPS/

研究の動機と目的

  • 学習された特徴記述子の学習において、限られた、偏った、または疎な正例対応アノテーションの課題に対処すること。
  • 相対カメラポーズへの監視に限定することで、より大規模で多様なデータセットでの学習を可能にすること。
  • ピクセル単位の対応情報ではなく、カメラポーズからの幾何的制約を用いて特徴記述子を最適化できる微分可能フレームワークの開発。
  • カメラポーズによる弱教師付き学習が、完全教師あり手法に匹敵またはそれを上回る特徴記述子を生成できることを示すこと。

提案手法

  • 相対カメラポーズを活用して潜在的対応関係の幾何的関係を定義する、新しいエピポーラ制約損失を定式化する。
  • 対応予測プロセスを微分可能にするマッチング層を導入し、全体のパイプラインを微分可能にする。
  • まず低解像度でマッチングを計算し、その後高解像度で精緻化することで、精度と効率を向上させるコarse-to-fineアーキテクチャを採用する。
  • トレーニングの安定化と一般化性能の向上のため、サイクル整合性と不確実性の再重み付けを用いる。
  • 正例キーポイント対応情報が一切不要な状態で、カメラポーズのみを用いてエンドツーエンドに学習する。
  • 入力画像に対して密な記述子を生成し、下流タスクで任意のキーポイント検出器と組み合わせて利用可能である。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位の対応アノテーションが一切ない状態で、カメラポーズの監視のみを用いて特徴記述子を効果的に学習できるか?
  • RQ2エピポーラ幾何を弱教師付き信号として活用し、深層特徴記述子を学習する方法は何か?
  • RQ3マッチングプロセスを微分可能にする対応モジュールを設計できるか?
  • RQ4コarse-to-fineアーキテクチャは、単一スケールの代替手法と比較して、記述子の品質とトレーニングの安定性を向上させるか?
  • RQ5カメラポーズによる弱教師付き学習で得た記述子は、完全教師あり手法に匹敵またはそれを上回る性能を示せるか?

主な発見

  • CAPSの記述子は、正例対応情報が一切ないにもかかわらず、画像マッチングやSfMを含む複数の幾何的タスクで、先行する完全教師ありSOTA手法を上回る性能を示した。
  • HPatchesデータセットでは、平均平均精度(MMA)が87.6、PCKスコアが92.1を達成し、以前の完全教師あり手法を上回った。
  • アブレーションスタディの結果、弱教師付き条件下ではエピポーラ制約損失が三重項損失や対照的損失よりも優れており、サイクル整合性は僅かな向上しかもたらさなかった。
  • ランダム初期化からトレーニングを開始しても(Ours from scratch)正常に収束したため、提案された損失関数とアーキテクチャの頑健性が示された。
  • コarse-to-fineモジュールは性能を顕著に向上させたことから、階層的特徴表現がマッチング精度を向上させることを示唆している。
  • カメラポーズのみで学習しても、CAPSは競争力のあるSfM結果を達成し、再構築完全性85.3%、再投影誤差1.8ピクセルを達成した。これは、実世界のシナリオへの強い一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。