Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional networks for real-time 6-DOF camera relocalization.

Alex Kendall, Matthew Koichi Grimes|arXiv (Cornell University)|May 27, 2015
Robotics and Sensor-Based Localization参考文献 22被引用数 51
ひとこと要約

本論文は、転移学習と23層の深層アーキテクチャを用い、1枚のRGB画像からカメラポーズを直接回帰することで、リアルタイムでモノクロナル6自由度カメラ再局所化を実現するエンドツーエンドの畳み込みニューラルネットワーク(CNN)を提案する。屋外の大規模なシーンでは2mおよび3°の精度を達成し、屋内では0.5mおよび5°の精度を達成する。1フレームあたり5msの推論速度を実現する。

ABSTRACT

Figure 1: Convolutional neural network monocular camera relocalization. Relocalization results for an input image (top), the predicted camera pose of a visual reconstruction (middle), shown again overlaid in red on the original image (bottom). Our system relocalizes to within approximately 2m and 3 ◦ for large outdoor scenes spanning 50, 000m2. We present a robust and real-time monocular six de-gree of freedom relocalization system. Our system trains a convolutional neural network to regress the 6-DOF cam-era pose from a single RGB image in an end-to-end man-ner with no need of additional engineering or graph op-timisation. The algorithm can operate indoors and out-doors in real time, taking 5ms per frame to compute. It obtains approximately 2m and 3◦accuracy for large scale outdoor scenes and 0.5m and 5◦accuracy indoors. This is achieved using an efficient 23 layer deep convnet, demon-strating that convnets can be used to solve complicated out of image plane regression problems. This was made possi-ble by leveraging transfer learning from large scale classi-fication data. We show the convnet localizes from high level features and is robust to difficult lighting, motion blur and different camera intrinsics where point based SIFT registra-tion fails. Furthermore we show how the pose feature that is produced generalizes to other scenes allowing us to regress pose with only a few dozen training examples. 1.

研究の動機と目的

  • 特徴マッチングやグラフ最適化に依存しない、1枚のRGB画像からのリアルタイムで堅牢な6自由度カメラ再局所化を可能にすること。
  • 従来のSIFTベースの手法が失敗するような、照明の変化、モーショーブラー、異なるカメラ内部パrameter(内パラメータ)の問題に対処すること。
  • 深層CNNが、数10例のトレーニング例のみで新しいシーンに一般化できることを示すこと。
  • 実世界の屋外および屋内環境への展開を想定し、高い精度と低遅延(1フレームあたり5ms)の推論を達成すること。

提案手法

  • 1枚のRGB画像から6自由度カメラポーズ(3つの並進、3つの回転)を直接回帰する、エンドツーエンドにトレーニングされた23層の深層畳み込みニューラルネットワークを採用する。
  • 再局所化タスクのファインチューニングの前に、大規模な画像分類データセットでネットワークを事前学習することで、転移学習を適用する。
  • 照明の変化、モーショーブラー、異なるカメラ内パラメータに対して強い高レベルの視覚的特徴を学習する。
  • 幾何的制約や後処理最適化を明示的に用いずにポーズ回帰を実行することで、リアルタイム推論を可能にする。
  • 最小限のファインチューニングで、新しいシーンに一般化可能であり、1シーンあたり数10例のトレーニング例で十分である。
  • 推論処理を最適化し、1フレームあたり5msで実行可能にすることで、標準ハードウェア上でのリアルタイム動作を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層CNNは、1枚のRGB画像から高精度かつ低遅延で6自由度カメラポーズを回帰できるか?
  • RQ2モーショーブラーや照明変化といった困難な視覚的条件下でも、CNNベースの再局所化システムはどれほど頑健か?
  • RQ3学習されたポーズ特徴は、最小限の再トレーニングでどの程度異なるシーンに一般化できるか?
  • RQ4大規模な分類データからの転移学習は、新しい環境における少データ再局所化の性能をどのように向上させるか?
  • RQ5エンドツーエンドのCNNアプローチは、従来のSIFTベースやグラフ最適化手法と比較して、精度と速度の面でどの程度優れているか?

主な発見

  • 本システムは、50,000m²にわたる大規模な屋外シーンにおいて、2mおよび3°の再局所化精度を達成した。
  • 屋内では0.5mおよび5°の精度を達成し、複雑な環境下でも優れた性能を示した。
  • モデルは1フレームあたり5msでカメラポーズを計算し、標準ハードウェア上でのリアルタイム動作を実現した。
  • 新しいシーンに、数10例のトレーニング例のみで一般化可能であり、展開に必要なデータ量を削減した。
  • モーショーブラーや照明変化といった困難な条件下でも、ポイントベースのSIFT登録法を上回る性能を示した。
  • 大規模な分類データからの転移学習は、ポーズ回帰タスクの性能と頑健性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。