Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Deep Visual Odometry with Online Adaptation

Shunkai Li, Xin Wang|arXiv (Cornell University)|May 13, 2020
Robotics and Sensor-Based Localization参考文献 42被引用数 5
ひとこと要約

本稿では、オンラインメタラーニングと特徴量アライメントを組み合わせた自己教師付き深層ビジョウ・オドメトリ手法を提案し、未確認の環境へのリアルタイム適応を可能にする。時系列記憶にconvLSTMを活用し、動的特徴量分布アライメントを施すことで、真値データが不要な状態でも高速かつ継続的な適応が実現され、未確認の屋外・屋内・合成データセットにおいて、相対的ポーズ誤差でSOTA手法を最大30%上回る性能を達成。32 FPSで動作する。

ABSTRACT

Self-supervised VO methods have shown great success in jointly estimating camera pose and depth from videos. However, like most data-driven methods, existing VO networks suffer from a notable decrease in performance when confronted with scenes different from the training data, which makes them unsuitable for practical applications. In this paper, we propose an online meta-learning algorithm to enable VO networks to continuously adapt to new environments in a self-supervised manner. The proposed method utilizes convolutional long short-term memory (convLSTM) to aggregate rich spatial-temporal information in the past. The network is able to memorize and learn from its past experience for better estimation and fast adaptation to the current frame. When running VO in the open world, in order to deal with the changing environment, we propose an online feature alignment method by aligning feature distributions at different time. Our VO network is able to seamlessly adapt to different environments. Extensive experiments on unseen outdoor scenes, virtual to real world and outdoor to indoor environments demonstrate that our method consistently outperforms state-of-the-art self-supervised VO baselines considerably.

研究の動機と目的

  • 自己教師付きビジョウ・オドメトリにおけるドメインシフト問題に取り組む。これは、未確認の環境でモデル性能が著しく低下する要因である。
  • 真値データにアクセスできない状況下でも、環境の変化に応じて継続的かつリアルタイムにVOネットワークを適応可能にする。
  • 過去の経験と動的特徴量アライメントを活用することで、オンライン適応中の推定精度と収束速度を向上させる。
  • 多様なシーンで堅牢な性能を発揮するため、オンライン適応を学習目的に統合したメタラーニングフレームワークを開発する。

提案手法

  • 本手法は、スライディングウィンドウによる過去フレーム群の空間的・時系列的依存関係をエンコードするため、畳み込みLSTM(convLSTM)を採用。これにより、より良いポーズおよび深度推定のため、長期的な経験を保持・活用可能となる。
  • 本稿では、現在および過去のデータに基づき将来のフレームでの性能最適化を目的として、迅速な新環境への適応が可能な、新規のオンラインメタラーニング方式を導入。
  • 時間軸に跨る特徴量アライメントを適用し、照明・テクスチャ・シーンのダイナミクスの変化に起因する特徴量の分布シフトを低減。これにより、オープンワールド環境における一般化性能が向上。
  • 推論時における真値ポーズや深度の必要性を排除するため、写真的一致性損失を用いて自己教師学習でネットワークを訓練。
  • 1枚のGPU上で32 FPSで動作し、デプロイ時におけるオンラインリファインメントを可能にする。
  • 適応速度と精度のバランスを考慮し、N=15のスライディングウィンドウを採用。性能はこのウィンドウサイズでピークに達する。

実験結果

リサーチクエスチョン

  • RQ1真値データにアクセスできない状況下でも、自己教師付きVOネットワークが未確認環境に迅速かつ安定して適応できるか?
  • RQ2convLSTMによる過去経験の統合は、オープンワールド環境における推定精度と適応速度をどのように向上させるか?
  • RQ3オンライン特徴量分布アライメントは、ビジョウ・オドメトリにおけるドメインシフトに起因する性能低下をどの程度緩和できるか?
  • RQ4収束速度と最終精度の観点から、オンラインメタラーニングは、単純なオンラインファインチューニングに比べてどのように優れているか?

主な発見

  • 提案手法は、TUM-RGBDのfr3/str_ntex_nearシーケンスで相対的ポーズ誤差(RPE)0.128 m/sを達成。SAVO(0.204 m/s)およびGeoNet(0.198 m/s)を上回り、優れた一般化性能を示した。
  • KITTIデータセットでは、未確認シーケンスで推定誤差をベースラインの11.65 m/sから4.79 m/sまで低減。ゼロショット一般化性能が顕著に優れている。
  • アブレーションスタディの結果、convLSTMと特徴量アライメントをメタラーニングと組み合わせた場合が最良の性能を示し、ベースライン比で誤差を58%低減した。
  • GeForce 1080Ti上で32 FPSで動作し、実用的デプロイに適したリアルタイムでのオンライン適応が可能。
  • 適応の最適なスライディングウィンドウサイズはN=15であり、それ以上のサイズでは収束が遅くなり、精度も低下する傾向にある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。