Skip to main content
QUICK REVIEW

[論文レビュー] LENS: Localization enhanced by NeRF synthesis

Arthur Moreau, Nathan Piasco|arXiv (Cornell University)|Oct 13, 2021
Robotics and Sensor-Based Localization参考文献 33被引用数 17
ひとこと要約

LENSは、NeRF-Wを用いてシーンの3Dジオメトリに整合した合成新規ビューを生成することで、カメラポーズ回帰を向上させる。均一にサンプリングされた仮想カメラポーズを用い、シーン全体のジオメトリにわたって実施される。このデータ拡張により、Cambridge Landmarksと7-Scenesで中央値の局所化誤差が60%低下し、構造に基づく手法と同等の性能を達成するが、アーキテクチャの変更は不要である。

ABSTRACT

Neural Radiance Fields (NeRF) have recently demonstrated photo-realistic results for the task of novel view synthesis. In this paper, we propose to apply novel view synthesis to the robot relocalization problem: we demonstrate improvement of camera pose regression thanks to an additional synthetic dataset rendered by the NeRF class of algorithm. To avoid spawning novel views in irrelevant places we selected virtual camera locations from NeRF internal representation of the 3D geometry of the scene. We further improved localization accuracy of pose regressors using synthesized realistic and geometry consistent images as data augmentation during training. At the time of publication, our approach improved state of the art with a 60% lower error on Cambridge Landmarks and 7-scenes datasets. Hence, the resulting accuracy becomes comparable to structure-based methods, without any architecture modification or domain adaptation constraints. Since our method allows almost infinite generation of training data, we investigated limitations of camera pose regression depending on size and distribution of data used for training on public benchmarks. We concluded that pose regression accuracy is mostly bounded by relatively small and biased datasets rather than capacity of the pose regression model to solve the localization task.

研究の動機と目的

  • ビデオシーケンスからの偏りのある非一様なトレーニングデータがカメラポーズ回帰器の一般化性能を著しく低下させることを是正すること。
  • NeRFを用いて多様で空間的にバランスの取れた合成データセットを生成することで、ポーズ回帰の精度を向上させること。
  • 大規模で均等に分布した合成データでトレーニングされた場合、ポーズ回帰が構造に基づく手法の性能に達することを実証すること。
  • モデルの容量とは無関係に、データ量と分布がポーズ回帰性能に与える影響を調査すること。
  • 合成データ拡張を用いて、埋め込み型ロボットシステムにおけるリアルタイムで低メモリの再局所化を可能にすること。

提案手法

  • LENSは、既知のポーズを持つ実画像を用いてNeRF-Wでニューラルレイトランスフィールドを訓練し、3Dシーンジオメトリと外観を学習する。
  • 仮想カメラポーズは、シーン全体にわたって均等な3Dグリッド上に生成され、NeRFの内部ジオメトリを用いて遮蔽されたり退化した視点を除外する。
  • 最適化された仮想ポーズから合成画像がレンダリングされ、幾何学的整合性と写真画質を確保する。
  • ポーズ回帰器は、実画像とNeRFで生成された合成画像の組み合わせデータセットでトレーニングされ、一般化性能が向上する。
  • オンライン局所化の際の高速でリアルタイムの推論を実現するために、軽量モデルであるCoordiNetが使用される。
  • 実画像と合成画像を混合することでドメインギャップを回避し、合成画像と実画像の分布の差を低減する。

実験結果

リサーチクエスチョン

  • RQ1NeRFベースの新規ビュー合成は、ポーズ回帰を向上させる高品質で幾何学的に整合した画像を生成できるか?
  • RQ2シーン全体にわたって均一に分布した合成データセットでトレーニングすることで、実世界の動画ベースのトレーニングに比べて局所化誤差が顕著に低減するか?
  • RQ3ポーズ回帰の精度は、モデル容量よりもデータ分布の制限によって主に制限されているとまではどの程度まで言えるか?
  • RQ4合成データ拡張によって、学習ベースと構造に基づく局所化手法の性能格差を埋め合わせることができるか?
  • RQ5トレーニングデータのサイズと分布が、実世界のシナリオにおけるポーズ回帰器の一般化に与える影響は何か?

主な発見

  • Cambridge Landmarksデータセットにおいて、LENSはベースラインのポーズ回帰に比べ、中央値の並進誤差と回転誤差を60%削減した。
  • 7-ScenesのFireシーンでは、トレーニングデータをLENSで生成された合成ビューに置き換えることで、中央値誤差が27cm/11.7°から8cm/3.5°に低下した。
  • 合成データで最大5000%の増加を達成した場合、7-Scenesでは中央値誤差0.03m/1.4°を達成し、構造に基づく手法の性能に一致した。
  • 研究の結論として、ポーズ回帰の精度は主にデータバイアスと不足に起因しており、モデル容量やアーキテクチャに起因するものではないとされた。
  • 合成データのみでのトレーニングではドメインギャップのため失敗する。実画像テストで堅牢性を確保するには、実画像と合成画像の混合が不可欠である。
  • LENSは1枚あたり50ms未満の推論時間と50MB未満のメモリ使用量を実現し、埋め込み型ロボットアプリケーションに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。