Skip to main content
QUICK REVIEW

[論文レビュー] Full-Frame Scene Coordinate Regression for Image-Based Localization

Xiaotian Li, Juha Ylioinas|arXiv (Cornell University)|Feb 9, 2018
Robotics and Sensor-Based Localization参考文献 6被引用数 3
ひとこと要約

本論文は、画像ベースの局所化のロバスト性と効率性を向上させるために、完全畳み込みエンコーダデコーダネットワークを用いたフルフレームシーン座標回帰手法を提案する。グローバルコンテキストと2次元/3次元のデータ拡張を活用することで、繰り返し構造を持つ困難なフレームにおいても最先端の性能を達成し、パッチベース手法よりも精度と速度で優れている。

ABSTRACT

Image-based localization, or camera relocalization, is a fundamental problem in computer vision and robotics, and it refers to estimating camera pose from an image. Recent state-of-the-art approaches use learning based methods, such as Random Forests (RFs) and Convolutional Neural Networks (CNNs), to regress for each pixel in the image its corresponding position in the scene's world coordinate frame, and solve the final pose via a RANSAC-based optimization scheme using the predicted correspondences. In this paper, instead of in a patch-based manner, we propose to perform the scene coordinate regression in a full-frame manner to make the computation efficient at test time and, more importantly, to add more global context to the regression process to improve the robustness. To do so, we adopt a fully convolutional encoder-decoder neural network architecture which accepts a whole image as input and produces scene coordinate predictions for all pixels in the image. However, using more global context is prone to overfitting. To alleviate this issue, we propose to use data augmentation to generate more data for training. In addition to the data augmentation in 2D image space, we also augment the data in 3D space. We evaluate our approach on the publicly available 7-Scenes dataset, and experiments show that it has better scene coordinate predictions and achieves state-of-the-art results in localization with improved robustness on the hardest frames (e.g., frames with repeated structures).

研究の動機と目的

  • 繰り返し構造を有する複雑なシーンを扱う際のパッチベースのシーン座標回帰の限界を解消すること。
  • フル画像入力アプローチを用いてグローバルコンテキストを座標予測に統合することで、局所化のロバスト性を向上させること。
  • パッチ単位の処理と比較して効率的なフルフレームネットワーク推論を可能にすることで、推論時間を短縮すること。
  • 新しい2次元および3次元のデータ拡張戦略を通じて、グローバルコンテキスト学習における過学習を克服すること。
  • 7-Scenesベンチマークにおいて、特に困難なフレームで最先端の局所化精度を達成すること。

提案手法

  • 全RGB画像を入力とし、全ピクセルに対して密な3次元シーン座標を出力する完全畳み込みエンコーダデコーダニューラルネットワークを採用する。
  • 2段階のパイプラインを採用:まず、提案されたCoordinate CNNによりフルフレームのシーン座標を予測し、次に予測された対応点をもとにRANSACを用いてカメラポーズを推定する。
  • 2次元画像空間(例:色のジャマ、クロップ)および3次元空間(例:ランダムなシーン回転・平行移動)でのデータ拡張を適用し、モデルの正則化と過学習の防止を図る。
  • すべてのピクセルについて予測値と真値の3次元座標間のL2損失を用いて、ネットワークをエンドツーエンドで訓練する。
  • 統合的なトレーニングと評価により、座標予測の正確性と下流の局所化パフォーマンスの両方を最適化する。
  • フルフレームネットワークの大きな受容 field を活用し、シーンのレイアウトやコンテキストをより良く捉えることで、テクスチャが乏しいまたは対称的なシーンでも一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1グローバルコンテキストを統合したフルフレームシーン座標回帰は、パッチベース手法と比較して局所化のロバスト性を向上させることができるか?
  • RQ22次元および3次元のデータ拡張を併用することで、フルフレーム座標回帰ネットワークのトレーニングにおける過学習をどれほど効果的に軽減できるか?
  • RQ3提案手法は、特に繰り返し構造や低テクスチャを有するフレームにおいて、より優れたパフォーマンスを達成するか?
  • RQ4パッチベース推論と比較して、フルフレームアーキテクチャは推論時間をどの程度短縮できるか?
  • RQ5グローバルコンテキストを持つ完全畳み込みネットワークは、より正確な中間座標予測を生成し、最終的な局所化精度の向上に寄与するか?

主な発見

  • 提案されたフルフレームCoordinate CNNは、DSACと比較して90.3%のインライア率(平均誤差28mm)を達成し、パッチベースベースラインを著しく上回った。
  • 7-Scenesデータセットにおける局所化パフォーマンスでは、本手法が累積ヒストограмの誤差閾値を下回る割合が、すべてのベースラインよりも速く100%に達しており、特にStairsシーンで顕著であった。
  • 最も困難なフレームでは、最大変位誤差が0.41m未満、回転誤差が13°未塔を記録した一方、DSACや[25]はしばしば2~5mおよび180°を超える誤差を示した。
  • フルフレームネットワークはパッチベース手法と比較して10倍以上高速(GTX 1080上での推論時間:0.02s vs. 0.3s)であり、モデルサイズも(約120MB)回帰フォレストベースのモデル(約250MB)よりも小さい。
  • データ拡張なしでは、フルフレームネットワークは一般化に失敗することが示され、2次元および3次元の拡張が、ロバストな座標予測のトレーニングに不可欠であることが明らかになった。
  • 本手法は、パッチベースおよびキーポイントベース手法を凌駕する最先端の局所化パフォーマンスを達成しており、特に繰り返し構造を有する困難なシナリオで顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。