Skip to main content
QUICK REVIEW

[論文レビュー] Learning Multiplicative Interactions with Bayesian Neural Networks for Visual-Inertial Odometry

Kashmira Shinde, Jong‐Seok Lee|arXiv (Cornell University)|Jul 15, 2020
Robotics and Sensor-Based Localization参考文献 34被引用数 5
ひとこと要約

本稿では、マルチヘッド自己注意機構を用いて乗法的相互作用を学習することでセンサ連合のロバスト性を向上させる、モノクロムビジョインertialオドメトリ(VIO)のエンドツーエンドベイジアンニューラルネットワークを提案する。スケーラブルなラプラス近似を用いた不確実性推定を組み込むことで、KITTIデータセット上でのセンサ劣化下でも最先端の精度と優れた耐性を達成し、乗法的相互作用がロバストなVIOに強力なインダクティブバイアスとして機能することを示している。

ABSTRACT

This paper presents an end-to-end multi-modal learning approach for monocular Visual-Inertial Odometry (VIO), which is specifically designed to exploit sensor complementarity in the light of sensor degradation scenarios. The proposed network makes use of a multi-head self-attention mechanism that learns multiplicative interactions between multiple streams of information. Another design feature of our approach is the incorporation of the model uncertainty using scalable Laplace Approximation. We evaluate the performance of the proposed approach by comparing it against the end-to-end state-of-the-art methods on the KITTI dataset and show that it achieves superior performance. Importantly, our work thereby provides an empirical evidence that learning multiplicative interactions can result in a powerful inductive bias for increased robustness to sensor failures.

研究の動機と目的

  • 自動運転などのセーフティクリティカルなアプリケーションにおいて、センサ劣化下でもロバストなビジョインエントリアルオドメトリを実現することに挑戦する。
  • 従来の加法的融合戦略(例:連結や重み付き融合)に起因する限界を克服し、視覚的およびインertialモダリティ間の複雑で補完的な相互作用をモデル化できない問題を解決する。
  • 自己注意機構を用いて学習する乗法的相互作用が、エンドツーエンドVIOにおけるロバスト性と一般化性能を向上させるかを調査する。
  • スケーラブルなラプラス近似を用いてモデルの不確実性推定を統合し、予測の信頼性と解釈可能性を向上させる。
  • 乗法的融合が加法的融合に比べて、特に悪条件下のセンサ環境においてより強いインダクティブバイアスを提供することを実証する。

提案手法

  • 視覚的およびインエントリアル特徴間の乗法的相互作用をモデル化するためにマルチヘッド自己注意機構を採用し、動的で注意駆動型の融合を実現する。
  • フローネットベースのアーキテクチャを用いて連続するモノクロム画像から幾何的特徴を抽出し、双方向LSTMを用いて生のIMU測定値を符号化する。
  • 融合関数を $ f(\mathbf{u}, \mathbf{v}) = \mathbf{v}^T \mathcal{W} \mathbf{u} + \mathbf{v}^T \mathbf{W}_v + \mathbf{W}_u \mathbf{u} + \mathbf{a} $ として定式化し、乗法的相互作用の核となる学習可能な積項 $ \mathbf{v}^T \mathcal{W} \mathbf{u} $ に重点を置く。
  • スケーラブルなラプラス近似を適用してネットワーク重みの事後分布を近似し、$ T = 30 $ 個のマルコフチェーンモンテカルロサンプルを用いてベイジアン不確実性推定を実現する。
  • 不確実性推定の安定化のため、$ NF + \tau I $ を用いてヘシアン近似を正則化する。ここで $ F $ はフィッシャー情報の近似である。
  • 予測の平均値を出力として使用し、不確実性の定量的評価に分散を用いる不確実性認識損失関数を用いて、エンドツーエンドのネットワークを端末から端末まで訓練する。

実験結果

リサーチクエスチョン

  • RQ1マルチヘッド自己注意機構を用いて学習する乗法的相互作用は、センサ劣化下におけるエンドツーエンドビジョインエントリアルオドメトリのロバスト性を向上させるか?
  • RQ2スケーラブルなラプラス近似によるモデル不確実性推定は、VIO予測の信頼性と解釈可能性を向上させるか?
  • RQ3提案手法は、FC-fusion やソフト/ハード特徴選択などの最先端の加法的融合手法(例:SOTA)と比較して、精度およびロバスト性において優れているか?
  • RQ4現実の劣化環境下において、乗法的融合機構が加法的機構に比べてどれほど強いインダクティブバイアスを提供するか?
  • RQ5予測された不確実性は、劣化したセンサ環境下で実際の誤差の大きさを信頼性を持って反映しているか?

主な発見

  • 提案手法は、名目のKITTIシーケンスにおいて11.42の平均変位誤差を達成し、VINet、DeepVO、VIO Softを含むすべてのベースラインを上回った。
  • IMU劣化下では、平均変位誤差が12.48に低下し、VIO Soft(14.05)およびVINet(13.65)を著しく上回った。
  • すべてのビジョセンサ劣化シナリオでは、平均変位誤差が12.61に達し、VIO Soft(14.59)およびVINet(13.65)を上回った。
  • 完全なセンサ劣化下でも、平均変位誤差が12.47を維持し、他のモデルが失敗するか著しく性能を落とす中で、ロバスト性を示した。
  • 予測された不確実性は実際の誤差と良好に相関しており、劣化状態では高い分散が観察された。これにより、不確 Promise 推定の信頼性が裏付けられた。
  • 可視化結果から、深刻な劣化下でも予測トラジェクトリが真値に近く保たれていることが確認され、モデルのロバスト性および一般化能力を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。