[论文解读] PRGFlow: Benchmarking SWAP-Aware Unified Deep Visual Inertial Odometry
PRGFlow 提出了一种面向下视/上视相机、IMU 和高度计的 SWAP 敏感、统一的深度学习框架,用于视觉-惯性里程计,实现了在各类空中机器人上低延迟、鲁棒的 6DoF 运动估计。通过优化的网络架构、损失函数和硬件感知压缩,实现端到端学习,在真实飞行测试中实现了轨迹长度 <3% 的 RMSE。
Odometry on aerial robots has to be of low latency and high robustness whilst also respecting the Size, Weight, Area and Power (SWAP) constraints as demanded by the size of the robot. A combination of visual sensors coupled with Inertial Measurement Units (IMUs) has proven to be the best combination to obtain robust and low latency odometry on resource-constrained aerial robots. Recently, deep learning approaches for Visual Inertial fusion have gained momentum due to their high accuracy and robustness. However, the remarkable advantages of these techniques are their inherent scalability (adaptation to different sized aerial robots) and unification (same method works on different sized aerial robots) by utilizing compression methods and hardware acceleration, which have been lacking from previous approaches. To this end, we present a deep learning approach for visual translation estimation and loosely fuse it with an Inertial sensor for full 6DoF odometry estimation. We also present a detailed benchmark comparing different architectures, loss functions and compression methods to enable scalability. We evaluate our network on the MSCOCO dataset and evaluate the VI fusion on multiple real-flight trajectories.
研究动机与目标
- 开发一种适用于在严格尺寸、重量、功耗和面积(SWAP)约束下运行的多样化空中机器人的统一、可扩展的基于深度学习的视觉-惯性里程计系统。
- 解决在资源受限平台的端到端深度 VIO 中,压缩、网络架构和损失函数选择缺乏系统性基准测试的问题。
- 仅使用常见传感器(单目相机、IMU 和高度计:气压计/声纳/LIDAR)实现鲁棒、实时的里程计估计。
- 为研究人员和从业者提供基于真实飞行性能和延迟的最优网络-硬件组合选择的实际参考。
提出的方法
- 将 IMU 估计的姿态补偿后的图像帧作为输入,送入深度神经网络,以预测平移位移、缩放和偏航变化。
- 利用高度计数据将预测的位移缩放为度量速度,实现在无显式深度监督下的度量里程计。
- 使用带 L2 损失的监督学习进行端到端训练,最小化预测运动参数的回归误差。
- 采用变形块(warping blocks)来预测连续图像帧之间的几何变换(平移、缩放、旋转)。
- 对多种架构(VanillaNet、ResNet、SqueezeNet、MobileNet、ShuffleNet)进行基准测试,其深度、宽度和压缩技术各不相同。
- 在 Jetson TX2、Coral USB 和 NanoPi Neo 等硬件平台上评估推理速度、精度和参数量。
实验结果
研究问题
- RQ1在小型空中机器人上实现实时 VIO 时,网络架构、压缩和推理速度之间的最优权衡是什么?
- RQ2不同损失函数(如 L2)如何影响真实飞行中端到端深度视觉里程计的精度和鲁棒性?
- RQ3哪种神经网络架构与硬件平台的组合能实现精度、延迟和 SWAP 效率的最佳平衡?
- RQ4在未进行微调的情况下,使用真实世界数据进行监督训练在多大程度上能泛化到真实飞行场景?
- RQ5变形块数量和网络深度如何影响性能和计算成本?
主要发现
- 所提出的 PRGFlow 框架在真实飞行实验中实现了小于总轨迹长度 3% 的 RMSE,表现出无需微调的高鲁棒性。
- 使用 L2 损失的监督训练在精度上显著优于无监督或自监督方法,尤其是在使用足够多真实世界数据变化的情况下。
- 尽管参数量更高,增加网络深度或宽度可在较小设备上提升推理速度,这得益于更优的内存访问模式和卷积操作效率。
- 在此里程计回归任务中,简单的权重剪枝优于复杂的知识蒸馏方法。
- 通过专用指令集(如 Jetson 或 Coral 上的)硬件加速可显著提升速度,使低功耗平台上的实时推理成为可能。
- 在恶劣条件下,该方法比经典方法更具容错性,凸显了深度学习在故障多发环境中的关键优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。