[论文解读] Beyond Tracking: Selecting Memory and Refining Poses for Deep Visual Odometry
本文提出了一种新颖的端到端深度视觉里程计框架,通过引入两个关键组件——用于自适应、长期全局上下文保持的Memory模块和利用时空注意力进行误差校正的Refining模块,提升了基于学习的视觉里程计性能。该方法显著优于当前最先进的基于学习的视觉里程计模型,并在纹理缺失和高动态场景中表现出与经典单目视觉里程计系统相当甚至更优的结果。
Most previous learning-based visual odometry (VO) methods take VO as a pure tracking problem. In contrast, we present a VO framework by incorporating two additional components called Memory and Refining. The Memory component preserves global information by employing an adaptive and efficient selection strategy. The Refining component ameliorates previous results with the contexts stored in the Memory by adopting a spatial-temporal attention mechanism for feature distilling. Experiments on the KITTI and TUM-RGBD benchmark datasets demonstrate that our method outperforms state-of-the-art learning-based methods by a large margin and produces competitive results against classic monocular VO approaches. Especially, our model achieves outstanding performance in challenging scenarios such as texture-less regions and abrupt motions, where classic VO algorithms tend to fail.
研究动机与目标
- 解决现有基于学习的视觉里程计方法将视觉里程计视为纯粹跟踪问题的局限性,忽视长期上下文信息与误差精炼。
- 通过自适应记忆机制显式保留全局信息,克服单目视觉里程计中的误差累积问题。
- 通过时空注意力机制利用存储记忆中的上下文特征,对先前预测进行精炼,从而提升位姿估计精度。
- 增强在挑战性环境(如纹理缺失区域和剧烈运动)下的鲁棒性,这些场景下经典视觉里程计系统往往失效。
- 在保持端到端学习与改进泛化能力的同时,实现与经典单目视觉里程计方法(如ORB-SLAM2、DSO)相当的性能。
提出的方法
- 引入Memory模块,自适应地选择并存储关键帧的特征,随时间减少冗余,同时保留长期上下文信息。
- 采用基于卷积LSTM的Tracking模块,将当前特征与隐藏状态融合,维持空间与时间的一致性。
- 实现Refining模块,利用Memory重新评估并校正先前的位姿估计,通过时空注意力机制完成。
- 应用双重注意力机制——空间与时间注意力——从Memory中选择性地提取相关特征,用于位姿精炼。
- 端到端训练整个网络,实现跟踪、记忆选择与位姿精炼的联合优化。
- 在Refining模块中采用特征重组策略,将每个视图与Memory中存储的全局上下文对齐,提升配准精度。
实验结果
研究问题
- RQ1自适应记忆机制是否能提升基于学习的视觉里程计中的长期一致性并减少误差累积?
- RQ2时空注意力机制在利用存储的全局上下文信息精炼过去位姿估计方面有多高效?
- RQ3所提出的框架在标准基准测试中相较于当前最先进的基于学习的视觉里程计方法,性能提升程度如何?
- RQ4该框架是否能在纹理缺失区域和快速相机运动等挑战性条件下保持高精度?
- RQ5各个组件(Memory与Refining)对整体性能的贡献程度如何,尤其是在与消融模型对比时?
主要发现
- 所提方法在KITTI与TUM-RGBD两个基准数据集上均优于当前最先进的基于学习的视觉里程计方法,在大多数序列中实现了更低的平移RMSE。
- 在TUM-RGBD数据集中,模型在fr3/nstr_tex_near_loop序列上达到0.010 m的平移RMSE,在fr3/str_ntex_far序列上达到0.035 m,优于ORB-SLAM2与DSO,尤其在纹理贫乏与运动挑战性场景中表现更优。
- 消融实验确认Memory与Refining组件均至关重要:移除时间或空间注意力会显著降低性能,尤其在挑战性序列中。
- 该模型在与ORB-SLAM2、DSO等经典单目视觉里程计系统对比中表现具有竞争力,尤其在纹理不足或快速运动的场景中表现突出。
- 结合时空注意力的Refining模块通过实现对过去估计的循环精炼,有效减少了误差传播,从而生成更稳定、更精确的轨迹。
- 该框架展现出强大的泛化能力,在训练过程中未见过的额外KITTI序列上仍保持高性能,表明其对领域偏移具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。