Skip to main content
QUICK REVIEW

[论文解读] Learning Multiplicative Interactions with Bayesian Neural Networks for Visual-Inertial Odometry

Kashmira Shinde, Jong‐Seok Lee|arXiv (Cornell University)|Jul 15, 2020
Robotics and Sensor-Based Localization参考文献 34被引用 5
一句话总结

本文提出了一种用于单目视觉-惯性里程计的端到端贝叶斯神经网络,通过多头自注意力机制学习乘法交互作用,以增强传感器融合的鲁棒性。通过引入可扩展的拉普拉斯近似进行不确定性估计,该方法在KITTI数据集上实现了最先进水平的精度,并在传感器退化条件下表现出更优的鲁棒性,表明乘法交互作用作为强大的归纳偏置,可显著提升鲁棒性VIO性能。

ABSTRACT

This paper presents an end-to-end multi-modal learning approach for monocular Visual-Inertial Odometry (VIO), which is specifically designed to exploit sensor complementarity in the light of sensor degradation scenarios. The proposed network makes use of a multi-head self-attention mechanism that learns multiplicative interactions between multiple streams of information. Another design feature of our approach is the incorporation of the model uncertainty using scalable Laplace Approximation. We evaluate the performance of the proposed approach by comparing it against the end-to-end state-of-the-art methods on the KITTI dataset and show that it achieves superior performance. Importantly, our work thereby provides an empirical evidence that learning multiplicative interactions can result in a powerful inductive bias for increased robustness to sensor failures.

研究动机与目标

  • 解决在自动驾驶等安全关键应用中,传感器退化条件下的鲁棒性视觉-惯性里程计挑战。
  • 克服现有加法融合策略(如拼接或加权融合)无法建模视觉与惯性模态之间复杂互补交互作用的局限性。
  • 探究通过注意力机制学习乘法交互作用是否能提升端到端VIO的鲁棒性与泛化能力。
  • 通过可扩展的拉普拉斯近似集成模型不确定性估计,以提升预测的可靠性与可解释性。
  • 证明在不利传感器条件下,乘法融合相比加法融合提供了更强的归纳偏置。

提出的方法

  • 采用多头自注意力机制建模视觉与惯性特征之间的乘法交互作用,实现动态、注意力驱动的融合。
  • 使用FlowNet架构从连续单目图像中提取几何特征,并采用双向LSTM编码原始IMU测量值。
  • 将融合函数表述为 $ f(\mathbf{u}, \mathbf{v}) = \mathbf{v}^T \mathcal{W} \mathbf{u} + \mathbf{v}^T \mathbf{W}_v + \mathbf{W}_u \mathbf{u} + \mathbf{a} $,强调可学习的乘积项 $ \mathbf{v}^T \mathcal{W} \mathbf{u} $ 作为乘法交互的核心。
  • 应用可扩展的拉普拉斯近似,近似网络权重的后验分布,通过 $ T = 30 $ 次蒙特卡洛采样实现贝叶斯不确定性估计。
  • 通过 $ NF + \tau I $ 正则化Hessian近似,其中 $ F $ 为Fisher信息近似,以稳定不确定性估计。
  • 使用不确定性感知损失函数端到端训练整个网络,以均值作为预测结果,以方差作为不确定性量化。

实验结果

研究问题

  • RQ1通过多头自注意力机制学习的乘法交互作用是否能提升在传感器退化条件下的端到端视觉-惯性里程计鲁棒性?
  • RQ2通过可扩展的拉普拉斯近似引入模型不确定性是否能提升VIO预测的可靠性与可解释性?
  • RQ3与最先进加法融合方法(如FC-fusion、软/硬特征选择)相比,所提方法在精度与鲁棒性方面表现如何?
  • RQ4在真实世界退化场景中,乘法融合机制作为归纳偏置相较于加法机制的优越性在多大程度上体现?
  • RQ5预测的不确定性是否能可靠地反映退化传感器条件下的实际误差大小?

主要发现

  • 所提方法在KITTI标准序列上实现了11.42的平均平移误差,优于所有基线模型,包括VINet、DeepVO和VIO Soft。
  • 在IMU退化条件下,该方法将平均平移误差降低至12.48,显著优于VIO Soft(14.05)和VINet(13.65)。
  • 在全视觉退化场景下,该方法实现了12.61的平均平移误差,优于VIO Soft(14.59)和VINet(13.65)。
  • 在全传感器退化条件下,该方法保持12.47的平均平移误差,展现出卓越鲁棒性,而其他模型则显著退化或失效。
  • 预测的不确定性与实际误差高度相关,在退化条件下观察到更高的方差,验证了不确定性估计的可靠性。
  • 可视化结果表明,即使在严重退化条件下,预测轨迹仍与真实轨迹保持接近,证实了模型的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。