[论文解读] TartanVO: A Generalizable Learning-based VO
TartanVO 是一种基于学习的视觉里程计模型,无需微调即可在多样化数据集和真实世界场景中实现泛化,其利用 TartanAir 的合成数据以及新型架构组件(如尺度无关损失和相机内参层)。该模型在 KITTI、EuRoC 和真实世界 RealSense 数据的挑战性轨迹上优于基于几何的方法,展现出在特征稀少和动态环境中的最先进鲁棒性。
We present the first learning-based visual odometry (VO) model, which generalizes to multiple datasets and real-world scenarios and outperforms geometry-based methods in challenging scenes. We achieve this by leveraging the SLAM dataset TartanAir, which provides a large amount of diverse synthetic data in challenging environments. Furthermore, to make our VO model generalize across datasets, we propose an up-to-scale loss function and incorporate the camera intrinsic parameters into the model. Experiments show that a single model, TartanVO, trained only on synthetic data, without any finetuning, can be generalized to real-world datasets such as KITTI and EuRoC, demonstrating significant advantages over the geometry-based methods on challenging trajectories. Our code is available at https://github.com/castacks/tartanvo.
研究动机与目标
- 开发一种基于学习的视觉里程计模型,使其在无需微调的情况下能够跨多样化的真实世界和合成数据集实现泛化。
- 解决现有基于学习的 VO 模型的局限性,这些模型通常因数据多样性不足以及对尺度和内参模糊性处理不佳而难以泛化。
- 提升在低纹理、动态和高运动等挑战性视觉里程计场景中的鲁棒性。
- 证明仅在合成数据上进行训练的单一模型即可在真实世界基准(如 KITTI 和 EuRoC)上实现具有竞争力的性能。
- 引入架构创新,明确处理单目尺度模糊性以及跨数据集的相机内参变化。
提出的方法
- 利用 TartanAir 合成数据集,该数据集提供多样化、高保真且具有挑战性的单目序列,包含精确的相机运动和场景变化。
- 采用尺度无关损失函数,使模型学习预测相对相机运动(尺度未知),避免对绝对尺度监督的依赖。
- 引入相机内参层(IL),显式将相机内参参数编码进网络,实现跨不同相机和传感器配置的泛化能力。
- 使用光流作为中间表示,模型从光流特征的变形结果中预测相机运动,提升对运动和外观变化的鲁棒性。
- 采用端到端方式训练模型,使用相机运动的监督信号进行训练,无需后端优化或迭代优化。
- 在训练过程中应用数据增强和领域随机化,以增强对真实世界光照、纹理和运动模式变化的鲁棒性。
实验结果
研究问题
- RQ1仅在合成数据上训练的基于学习的视觉里程计模型,是否能在不进行任何微调的情况下有效泛化到真实世界数据集?
- RQ2训练数据中的数据多样性在多大程度上影响基于学习的 VO 模型在不同环境和运动模式下的泛化性能?
- RQ3尺度无关损失函数在多大程度上能提升单目视觉里程计模型的鲁棒性和泛化能力?
- RQ4一种将相机参数嵌入网络的相机内参层,是否能实现跨数据集的泛化,适用于不同相机型号和内参配置?
- RQ5在低纹理、动态或高运动序列等挑战性真实世界场景中,基于学习的 VO 模型与基于几何的方法相比性能如何?
主要发现
- 在具有挑战性的 EuRoC 序列 VR1-03 和 VR2-03 上,TartanVO 分别取得 0.64 和 1.04 的 ATE,优于 ORB-SLAM 和 DSO 等基于几何的方法,达到最先进性能。
- 在 KITTI 数据集上,TartanVO 在 MH-04 上取得 0.74 的 ATE,在 MH-05 上取得 0.68,优于 SVO 和 ORB-SLAM,并在困难序列中表现出更优的鲁棒性。
- 在 TartanAir 测试集上,TartanVO 在全部 8 个序列上均取得具有竞争力的 ATE,包括 MH004 的 1.07 和 MH005 的 3.19,展现出对合成但具有挑战性的场景的强大泛化能力。
- 在真实世界的 RealSense D345i 红外(IR)数据上,TartanVO 在三个具有递增运动难度的环形轨迹中生成的里程计估计值,与 T265 跟踪相机输出高度一致,尽管训练过程中从未接触过真实 IR 数据。
- 由于采用尺度无关损失,模型在训练和测试损失之间差距极小,表明其具有强大的泛化能力并减少了对训练分布的过拟合。
- 相机内参层实现了有效的跨数据集泛化,使同一模型无需微调或适应即可在具有不同相机内参的多个数据集上表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。