Skip to main content
QUICK REVIEW

[論文レビュー] Learning models for visual 3D localization with implicit mapping

Dan Rosenbaum, Frederic Besse|arXiv (Cornell University)|Jul 4, 2018
Robotics and Sensor-Based Localization参考文献 40被引用数 17
ひとこと要約

本稿では、強化された生成クエリネットワーク(GQN)を用いた、暗黙的なシーン表現を介した視覚的3次元局所化のための生成学習アプローチを提案する。生成モデルが判別的ベースラインと比較して、シーン構造と不確実性をよりよく捉えていることが示されたが、テスト時最適化を要する一方で、判別的モデルは強い事前分布バイアスのおかげで真値ポーズにおける尤度が高くなる。

ABSTRACT

We consider learning based methods for visual localization that do not require the construction of explicit maps in the form of point clouds or voxels. The goal is to learn an implicit representation of the environment at a higher, more abstract level. We propose to use a generative approach based on Generative Query Networks (GQNs, Eslami et al. 2018), asking the following questions: 1) Can GQN capture more complex scenes than those it was originally demonstrated on? 2) Can GQN be used for localization in those scenes? To study this approach we consider procedurally generated Minecraft worlds, for which we can generate images of complex 3D scenes along with camera pose coordinates. We first show that GQNs, enhanced with a novel attention mechanism can capture the structure of 3D scenes in Minecraft, as evidenced by their samples. We then apply the models to the localization problem, comparing the results to a discriminative baseline, and comparing the ways each approach captures the task uncertainty.

研究の動機と目的

  • 生成モデル(GQNを含む)が、明示的な地図を用いずに、複雑な3次元環境の暗黙的かつ抽象的な表現を学習できるかどうかを調査すること。
  • このような暗黙的表現が、手続き的3次元シーンにおける正確な視覚的3次元局所化を支援できるかどうかを評価すること。
  • 不確実性モデリングとパフォーマンスの観点から、生成的および判別的学習アプローチを比較すること。
  • 注目メカニズムが、GQNベースのモデルにおけるシーン表現および局所化精度に与える影響を評価すること。

提案手法

  • 著者らは、トレーニングおよび評価用にカメラポーズのアノテーションが付与された、手続き的に生成されたマイクラフトの世界を用いて、多様な3次元シーンを構築した。
  • シーン表現学習とビュー生成の向上を目的として、GQNフレームワークに新しい空間的注目メカニズムを拡張した。
  • モデルは、文脈画像とそのポーズから、シーンの条件付き暗黙的表現を学習し、暗黙的推論により新しい画像(ターゲット)のポーズを予測できるようにする。
  • 局所化のため、生成モデルはポーズ空間全体にわたってモデルをクエリすることで、可能なポーズの確率分布を計算する。一方、判別的ベースラインは文脈画像から直接ポーズを回帰する。
  • 判別的モデルは、文脈画像とそのポーズを入力として、ターゲット画像のカメラポーズを直接回帰ヘッドを用いて予測するように訓練された。
  • パフォーマンスは、ポーズ予測の平均二乗誤差(MSE)と、予測分布における真値ポーズの対数尤度を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1手続き的に生成されたマイクラフトの3次元シーンの構造的複雑さを、強化された注目メカニズムを備えたGQNが捉えることができるか?
  • RQ2このような生成モデルは、明示的な地図が存在しない状況でも、視覚的3次元局所化に効果的に用いることができるか?
  • RQ3生成アプローチの不確実性モデリングは、判別的ベースラインと比較してどのように異なるか?
  • RQ4注目メカニズムの導入により、生成的および判別的両設定におけるシーン表現の質と局所化精度が向上するか?

主な発見

  • 注目メカニズムを備えた生成モデルは、20枚の文脈画像を用いて、ヨー角でテスト時MSEが0.07、x,y位置で0.08を達成し、不確実性を考慮した局所化においてベースラインを上回った。
  • 判別的モデルは真値ポーズに対する対数尤度が著しく高く(log-prob = -1.9)、生成モデル(log-prob = -4.1)と比較して、文脈ポーズの周辺に強い事前分布が集中していることを示した。
  • 生成モデルの確率分布は、未探索領域にわたってより一様であったため、トレーニングデータのポーズ事前分布バイアスの影響が少なく、不確実性をよりよく捉えていることが示された。
  • 注目メカニズムは両モデルのパフォーマンスを向上させたが、特に生成モデルで相対的な向上が大きく、暗黙的モデリングにおける表現学習の向上に寄与していることが示唆された。
  • 生成モデルは妥当な新しいビューのサンプルを生成でき、文脈画像から意味のある3次元シーン構造を学習できることを示した。
  • 不確実性モデリングが優れているものの、生成アプローチはテスト時最適化を要するため、1回の順伝播で動作する判別的モデルに比べ、効率が劣る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。