Skip to main content
QUICK REVIEW

[論文レビュー] Large Scale Joint Semantic Re-Localisation and Scene Understanding via Globally Unique Instance Coordinate Regression

Ignas Budvytis, Marvin Teichmann|arXiv (Cornell University)|Sep 23, 2019
Advanced Image and Video Retrieval Techniques被引用数 15
ひとこと要約

本論文は、物体ごとにグローバルに一意なインスタンスラベルと局所的な3D座標を同時に回帰することで、大規模な共同セマンティック再局所化とシーン理解のための新規な2段階のディーパンラーニングフレームワークを提案する。オブジェクトインスタンス認識と局所座標予測を分離することで、CamVid-360で22 cmの中央値距離誤差と0.71°の中央値角度誤差を達成し、実データおよび合成データの両方で最先端の性能を発揮し、大規模かつ近似された3Dマップを含む、より広範な環境でも優れた性能を示す。

ABSTRACT

In this work we present a novel approach to joint semantic localisation and scene understanding. Our work is motivated by the need for localisation algorithms which not only predict 6-DoF camera pose but also simultaneously recognise surrounding objects and estimate 3D geometry. Such capabilities are crucial for computer vision guided systems which interact with the environment: autonomous driving, augmented reality and robotics. In particular, we propose a two step procedure. During the first step we train a convolutional neural network to jointly predict per-pixel globally unique instance labels and corresponding local coordinates for each instance of a static object (e.g. a building). During the second step we obtain scene coordinates by combining object center coordinates and local coordinates and use them to perform 6-DoF camera pose estimation. We evaluate our approach on real world (CamVid-360) and artificial (SceneCity) autonomous driving datasets. We obtain smaller mean distance and angular errors than state-of-the-art 6-DoF pose estimation algorithms based on direct pose regression and pose estimation from scene coordinates on all datasets. Our contributions include: (i) a novel formulation of scene coordinate regression as two separate tasks of object instance recognition and local coordinate regression and a demonstration that our proposed solution allows to predict accurate 3D geometry of static objects and estimate 6-DoF pose of camera on (ii) maps larger by several orders of magnitude than previously attempted by scene coordinate regression methods, as well as on (iii) lightweight, approximate 3D maps built from 3D primitives such as building-aligned cuboids.

研究の動機と目的

  • 実世界のロボットや自動運転における堅牢でスケーラブルかつ検証可能な局所化システムのニーズに応えるために、セマンティック理解と6-DoFカメラポーズ推定を統合すること。
  • 特に構造欠損やドメインシフトなどの困難な条件下でも、大規模環境における直接的な6-DoFポーズ回帰やシーン座標回帰の限界を克服すること。
  • 密度の高い3Dポイントクラウドに依存せず、建物に整合したキューブイドなどの3Dプリミティブから構築された軽量で近似された3Dマップを用いて、正確なカメラ再局所化を可能にすること。
  • インスタンスセグメンテーションと局所座標回帰の分離によるタスク再定式化により、トレーニング収束の向上と予測精度の向上を図ること。
  • 実世界(CamVid-360)および合成データ(SceneCity)の両方、さらには異なるカメラ(例:Googleストリートビュー)を用いた再局所化を含む多様なシナリオにおける一般化能力を実証すること。

提案手法

  • 畳み込みニューラルネットワーク(CNN)を訓練し、各画素に対してグローバルに一意なインスタンスラベルと、そのオブジェクトの中心からの相対的な局所3D座標を予測する。
  • シーン座標回帰を2つの独立したタスクに分解する:(1) グローバルに一意な識別子を備えたインスタンスレベルのセマンティックセグメンテーション、(2) インスタンスごとの局所座標回帰。
  • 事前に計算された3Dマップからの予測されたオブジェクト中心座標と、画素単位の局所座標を組み合わせることで、グローバル3Dシーン座標を再構築する。
  • 再構築された3Dシーン座標からPnP(Perspective-n-Point)アルゴリズムを用いて6-DoFカメラポーズを推定する。
  • トレーニングおよび評価のため、高密度にスキャンされた動画シーケンスから正確な3Dポイントクラウドを生成するために、SfM(構造からモーション)を活用する。
  • アブレーションスタディを用いて設計選択を検証するため、L1、L2および表現損失(L5-LRec-Lab)を組み合わせたマルチタスク損失を用いてネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1シーン座標回帰をインスタンス認識と局所座標予測に効果的に分解することで、大規模環境におけるスケーラビリティと精度が向上するか?
  • RQ2本手法は、大規模な実世界(CamVid-360)および合成データ(SceneCity)の両方で、最先端の直接ポーズ回帰法およびシーン座標ベース手法と比較して、6-DoFカメラ再局所化においてどの程度の性能を示すか?
  • RQ3本手法は、異なるカメラ(例:Googleストリートビュー)や建物が欠落しているシーンなどの困難なシナリオにおいて、どの程度一般化できるか?
  • RQ4キューブイドなどの3Dプリミティブから構築された軽量で近似された3Dマップを用いて、正確な6-DoFポーズ推定が達成可能か?計算コストの低減が見込めるか?
  • RQ5インスタンスラベルと局所座標の予測を分離することで、エンドツーエンドのシーン座標回帰と比較して、収束が速くなり、性能が向上するか?

主な発見

  • 本手法は、CamVid-360データセットで22 cmの中央値距離誤差と0.71°の中央値角度誤差を達成し、直接6-DoF回帰およびシーン座標推定に基づく最先端手法を上回る性能を示した。
  • より大きなSceneCity Mediumデータセットでは、20 cmの中央値距離誤差と0.76°の中央値角度誤差を達成し、都市規模の環境へのスケーラビリティを示した。
  • CamVid-360では53%以上の画素が真値位置から50 cm以内に予測され、SceneCity Mediumでは39%の画素が同様に近接しており、高い幾何的正確性を示した。
  • L5-LRec-Lab損失(インスタンスラベルと局所座標予測の統合)は、PoseNet や L3-Rec-Repr などのすべてのベースラインを上回り、大規模マップにおける局所化精度で17%以上も優れた性能を発揮した。
  • Googleストリートビューの画像や建物が欠落しているシーンでテストした際、他の手法と比較してより高いロバスト性を示し、ドメインシフト下での強力な一般化能力を裏付けた。
  • キューブイドから構築された近似3Dマップを用いた場合、Small SceneCityデータではL5-LRec-Labを上回り、PoseNet や L3-3D-Repr をも凌駕した。これは、低コストでスケーラブルな展開が可能であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。