Skip to main content
QUICK REVIEW

[論文レビュー] CoVIO: Online Continual Learning for Visual-Inertial Odometry

Niclas Vödisch, Daniele Cattaneo|arXiv (Cornell University)|Mar 17, 2023
Robotics and Sensor-Based Localization被引用数 6
ひとこと要約

CoVIOは、埋め込み型デバイスで災害的忘却を軽減するため、固定サイズかつ多様性最適化されたリプレイバッファを用いた、軽量で単一ネットワークアーキテクチャのオンライン継続的学習を実現するビジュアルインertialオドメトリ(VIO)を提案する。リアルタイムで非同期推論が可能であり、従来の手法(例:CL-SLAM)に比べてドメイン適応性に優れ、メモリ使用量が低く、実世界のデータセットでも高い精度を維持する。

ABSTRACT

Visual odometry is a fundamental task for many applications on mobile devices and robotic platforms. Since such applications are oftentimes not limited to predefined target domains and learning-based vision systems are known to generalize poorly to unseen environments, methods for continual adaptation during inference time are of significant interest. In this work, we introduce CoVIO for online continual learning of visual-inertial odometry. CoVIO effectively adapts to new domains while mitigating catastrophic forgetting by exploiting experience replay. In particular, we propose a novel sampling strategy to maximize image diversity in a fixed-size replay buffer that targets the limited storage capacity of embedded devices. We further provide an asynchronous version that decouples the odometry estimation from the network weight update step enabling continuous inference in real time. We extensively evaluate CoVIO on various real-world datasets demonstrating that it successfully adapts to new domains while outperforming previous methods. The code of our work is publicly available at http://continual-slam.cs.uni-freiburg.de.

研究の動機と目的

  • テストドメインが学習データと異なるオープンワールド環境において、学習ベースのビジュアルインエラシャルオドメトリを実装する課題に対処すること。
  • 埋め込みプラットフォーム上で制限されたストレージを有する中で、経験リプレイを活用して継続的学習中の災害的忘却を克服すること。
  • 人間によるドメイン境界検出に依存せず、新しい環境への継続的かつ自動的な適応を可能にすること。
  • 二重ネットワークアーキテクチャ(例:CL-SLAM)に比べ、計算およびメモリのオーバーヘッドを低減し、低消費電力デバイス上でのリアルタイムデプロイを可能にすること。
  • 新規の多様な環境下でも、位置推定と回転推定の精度と耐性を向上させるために、新規の多様性駆動型リプレイ戦略を導入すること。

提案手法

  • CL-SLAMの二重ネットワークアーキテクチャを、ポーズと深度推定に共通して使用する単一で共有されたネットワークに置き換え、トレーニングの簡略化とGPUメモリ使用量の削減を図る。
  • ストレージ制限内で表現のカバレッジを最大化するため、学習可能な多様性指標を用いて、最も多様な画像のみを格納する固定サイズのリプレイバッファを実装する。
  • 既存のバッファサンプルと特徴量の相違度が大きい画像を優先する多様性ベースのサンプリング戦略を導入し、一般化性能の向上と冗長性の低減を図る。
  • 非同期更新メカニズムにより、モーション推定とネットワーク重みの更新を分離し、レイテンシの増加を伴わずに継続的な推論を可能にする。
  • オンライン適応中に、自己教師付き深度監視とポーズ整合性損失を用いた、ポーズネットとディープネットの自己教師付き共同トレーニングを実施する。
  • 1フレームごとに複数回の更新サイクルを適用してバックプロパゲーションを実行し、完全再トレーニングを必要とせずに重みを段階的に最適化する。

実験結果

リサーチクエスチョン

  • RQ1固定サイズかつ多様性最適化されたリプレイバッファを用いた、軽量で単一のネットワークアーキテクチャが、埋め込み型デバイス上での継続的ビジュアルインエラシャルオドメトリを効果的に実現できるか。
  • RQ2制限されたストレージ下で、無限大またはランダムなリプレイバッファと比較して、固定サイズかつ多様性最適化されたリプレイバッファは、一般化性能と精度においてどのように優れているか。
  • RQ3非同期オンライン学習が、継続的適応環境下で、精度を損なわずリアルタイム推論を実現できるか。
  • RQ4リプレイバッファサイズ、バッチサイズ、更新サイクル数といったハイパーパrameterの変更に対して、本手法の性能はどの程度感度を示すか。
  • RQ5提案手法が、CL-SLAMなどの既存の継続的学習ベースラインを、多様な実世界環境下で、並進誤差と回転誤差の両面で上回ることができるか。

主な発見

  • バッファサイズ100で、シーケンス04では2.11 m、シーケンス06では2.13 mの並進誤差を達成し、同じ条件下でCL-SLAMの2.79 mと1.98 mを上回った。
  • バッファサイズ100、多様性ベースのサンプリングを採用した場合、非多様リプレイ戦略と比較して、シーケンス04では並進誤差が23.6%低減、シーケンス06では19.7%低減した。
  • 非同期版のCoVIOは、真のリアルタイム推論を可能にした。モーション推定とモデル更新を分離することで、同期手法で一般的に見られるレイテンシのピークを回避した。
  • CoVIOはCL-SLAMよりも更新サイクル数に対して感受性が低く、1回のサイクルでほぼ最適な性能を達成した。これは収束効率の向上を示している。
  • バッチサイズ3、更新サイクル数5で、すべての評価設定において最小の並進誤差と回転誤差を達成した。表6では最小誤差を太字で示した。
  • 本手法は複数のドメインにわたり強力な性能を維持し、明示的なドメイン分類や人間の介入を必要とせずに、知識の保持とドメイン適応が効果的に行われていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。