Skip to main content
QUICK REVIEW

[論文レビュー] Scene Coordinate and Correspondence Learning for Image-Based Localization

Mai Bui, Shadi Albarqouni|arXiv (Cornell University)|May 22, 2018
Robotics and Sensor-Based Localization参考文献 26被引用数 16
ひとこと要約

本論文は、1枚のRGB画像から同時に3次元シーン座標とその予測信頼度を回帰する深層学習フレームワークを提案する。2次元-3次元対応点の信頼度スコアを予測することで、誤検出を早期にフィルタリングし、より頑健なポーズ推定と精緻化を可能にした。RGB入力での7-Scenesデータセットにおいて、回転誤差3.1°、並進誤差4.0 cmの最先端の精度を達成した。

ABSTRACT

Scene coordinate regression has become an essential part of current camera re-localization methods. Different versions, such as regression forests and deep learning methods, have been successfully applied to estimate the corresponding camera pose given a single input image. In this work, we propose to regress the scene coordinates pixel-wise for a given RGB image by using deep learning. Compared to the recent methods, which usually employ RANSAC to obtain a robust pose estimate from the established point correspondences, we propose to regress confidences of these correspondences, which allows us to immediately discard erroneous predictions and improve the initial pose estimates. Finally, the resulting confidences can be used to score initial pose hypothesis and aid in pose refinement, offering a generalized solution to solve this task.

研究の動機と目的

  • オクルージョンや低テクスチャ環境におけるカメラ再ローカライゼーションの精度を向上させるために、シーン座標予測に深層学習を活用する。
  • RANSACに基づく手法の限界を克服するため、2次元-3次元対応点の信頼度予測を導入し、誤ったマッチングを早期に除外する。
  • 初期ポーズ仮説の品質を向上させるとともに、最適化のしきい値をハードコードしない柔軟なポーズ精緻化を可能にする汎用フレームワークを構築する。
  • さまざまな損失関数および正則化手法がシーン座標回帰の品質に与える影響を分析する。
  • 信頼度予測が直接ポーズ回帰や標準的な対応点ベース手法よりも優れた性能を発揮することを実証する。

提案手法

  • 1枚のRGB入力画像の各ピクセルに対して、密な3次元シーン座標を予測する深層ニューラルネットワークを訓練する。
  • 回帰されたシーン座標の空間的整合性を向上させるために、損失関数に新しい滑らかさ正則化項を導入する。
  • 各2次元-3次元対応点の信頼度を予測する別々の信頼度ヘッドを訓練し、低信頼度のマッチングを早期に除外可能にする。
  • 信頼度スコアを用いてポーズ仮説をスコア付け・フィルタリングし、外れ値に対してより頑健な推定を実現する。
  • PnPまたはKabsch法を用いてポーズ推定を実行し、信頼度重み付き対応点を用いて精緻化を適用する。
  • フレームワークはモジュール型であり、さまざまなポーズ推定アルゴリズムと互換性があり、プラグアンドプレイで統合可能である。

実験結果

リサーチクエスチョン

  • RQ12次元-3次元対応点のシーン座標と信頼度スコアの統合的回帰は、標準的な対応点ベース手法と比較してカメラ再ローカライゼーションの精度を向上させるか?
  • RQ2損失関数に滑らかさ正則化項を組み込むことで、回帰されたシーン座標の品質と整合性はどのように変化するか?
  • RQ3信頼度予測により、誤った対応点の数をどの程度削減でき、ポーズ推定の頑健性が向上するか?
  • RQ4本手法は、PoseNetのような直接ポーズ回帰ベースラインや、DSACのような最先端の対応点ベース手法と比較して、どのように差をつけるか?
  • RQ5信頼度ベースのフィルタリング機構は、再トレーニングを必要とせずに、さまざまなシーンやデータセットに一般化可能か?

主な発見

  • 本手法は、RGB入力での7-Scenesデータセットにおいて、中央値回転誤差3.1°、並進誤差4.0 cmを達成し、PoseNetを上回り、最良の最先端手法と同等の精度を示した。
  • RGB-D入力では、中央値誤差が2.5°と5.2 cmにまで低下し、RGBのみの結果に比べて顕著な改善が見られ、シーン座標回帰フォレストと比較しても優れた性能を示した。
  • 信頼度予測機構により、ポーズ推定に必要なインライヤー点の数を削減でき、少ない対応点数でも正確な結果を得られるようになった。
  • PnPやRANSACを標準的に使用する状況でも、仮説生成の前に低信頼度対応点をフィルタリングすることで、ポーズ精度が向上した。
  • 計算効率に優れ、GPU加速付きネットワーク推論を用いたCPU上でも1.06秒で実行可能であり、Pythonで実装されているにもかかわらず、C++ベースのDSACを上回る速度を達成した。
  • アブレーションスタディにより、信頼度予測がポーズ精度を顕著に向上させることを確認した。特に、Stairsのような困難なシーンでは、ベースライン手法と比較して誤差を50%以上削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。