[论文解读] Lvio-Fusion: A Self-adaptive Multi-sensor Fusion SLAM Framework Using Actor-critic Method
Lvio-Fusion 提出了一种紧密耦合、自我适应的多传感器 SLAM 框架,通过因子图优化融合双目相机、LiDAR、IMU 和 GPS。它采用分段全局位姿图优化来校正城市场景中的漂移,并使用基于强化学习的演员-评论家智能体动态调整传感器权重,在 KITTI 和 KAIST 数据集上实现了高精度与实时性能。
State estimation with sensors is essential for mobile robots. Due to different performance of sensors in different environments, how to fuse measurements of various sensors is a problem. In this paper, we propose a tightly coupled multi-sensor fusion framework, Lvio-Fusion, which fuses stereo camera, Lidar, IMU, and GPS based on the graph optimization. Especially for urban traffic scenes, we introduce a segmented global pose graph optimization with GPS and loop-closure, which can eliminate accumulated drifts. Additionally, we creatively use a actor-critic method in reinforcement learning to adaptively adjust sensors' weight. After training, actor-critic agent can provide the system better and dynamic sensors' weight. We evaluate the performance of our system on public datasets and compare it with other state-of-the-art methods, which shows that the proposed method achieves high estimation accuracy and robustness to various environments. And our implementations are open source and highly scalable.
研究动机与目标
- 解决多传感器 SLAM 中在不同环境下传感器性能不一致的挑战。
- 利用 GPS 和回环闭合约束,减少大规模城市环境中累积的漂移。
- 开发一种动态、自适应的传感器融合机制,根据环境条件调整权重。
- 通过紧密耦合融合双目视觉、LiDAR、IMU 和 GPS,实现实时、高精度的轨迹估计。
提出的方法
- 系统使用视觉-惯性里程计提取关键帧,并将双目相机、LiDAR、IMU 和 GPS 作为因子进行因子图优化。
- 基于运动特性,对不同轨迹段应用分段全局位姿图优化,提升城市场景中的漂移校正效果。
- 并行训练一个演员-评论家强化学习智能体,根据实时性能反馈动态调整传感器因子的权重。
- 智能体在 KITTI 序列 02、05、06、07、09 上进行训练,并在序列 00 上进行验证,验证期间使用 RPE 作为评估指标。
- 轻量级的 TD3 基础智能体处理视觉和 LiDAR 特征以及 IMU 预积分结果,每帧关键帧的自适应权重计算耗时仅 5.56ms。
- 通过因子图架构,框架支持通过将新传感器作为额外因子实现即插即用的集成。
实验结果
研究问题
- RQ1多传感器 SLAM 系统如何在传感器可靠性各异的多样化环境中实现鲁棒且精确的状态估计?
- RQ2基于强化学习的智能体能否有效实现实时动态调整传感器融合权重,从而提升 SLAM 精度?
- RQ3分段全局优化结合 GPS 和回环闭合如何减少城市交通场景中的累积漂移?
- RQ4与固定权重融合相比,使用自适应传感器权重机制在复杂城市环境中能带来多大的性能提升?
主要发现
- 在 KITTI 数据集上,自适应 Lvio-Fusion 将序列 00 的 RPE RMSE 从 1.73m 降低至 1.39m,精度提升 20%。
- 在 KAIST 城市场景数据集中,Lvio-Fusion 实现了 6.31m 的 ATE RMSE,显著优于 VINS-Fusion 的 70.69m,即使在高度动态且信号受阻的 GPS 条件下也表现优异。
- 演员-评论家智能体通过实时学习最优传感器权重降低了误差,训练在第 3 个周期收敛并达到峰值测试奖励。
- 每帧关键帧的权重调整平均耗时仅为 5.56ms,证实了该方法的实时可行性。
- 分段全局优化有效缓解了城市场景中的漂移问题,即使在多径效应和信号遮挡导致 GPS 信号受损的情况下依然有效。
- 该框架为开源且高度可扩展,通过因子图架构可轻松集成新型传感器模态。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。