Skip to main content
QUICK REVIEW

[论文解读] VPAIR -- Aerial Visual Place Recognition and Localization in Large-scale Outdoor Environments

Michael Schleiss, Fahmi Rouatbi|arXiv (Cornell University)|May 23, 2022
Robotics and Sensor-Based Localization被引用 9
一句话总结

该论文介绍了VPAIR,一个从轻型飞机在300–400米高度拍摄的大规模航拍视觉位置识别与定位数据集,包含向下视角的图像,配以高分辨率地理参考渲染图和6-DoF位姿。实验表明,旋转鲁棒局部描述符(RoRD)在处理典型鸟瞰图航拍场景中的平面内旋转时,显著优于NetVLAD和SIFT等标准方法。

ABSTRACT

Visual Place Recognition and Visual Localization are essential components in navigation and mapping for autonomous vehicles especially in GNSS-denied navigation scenarios. Recent work has focused on ground or close to ground applications such as self-driving cars or indoor-scenarios and low-altitude drone flights. However, applications such as Urban Air Mobility require operations in large-scale outdoor environments at medium to high altitudes. We present a new dataset named VPAIR. The dataset was recorded on board a light aircraft flying at an altitude of more than 300 meters above ground capturing images with a downwardfacing camera. Each image is paired with a high resolution reference render including dense depth information and 6-DoF reference poses. The dataset covers a more than one hundred kilometers long trajectory over various types of challenging landscapes, e.g. urban, farmland and forests. Experiments on this dataset illustrate the challenges introduced by the change in perspective to a bird's eye view such as in-plane rotations.

研究动机与目标

  • 解决中高海拔户外环境中视觉位置识别(VPR)和视觉定位(VL)领域缺乏大规模航拍数据集的问题。
  • 研究现有VPR和VL技术在典型向下视角航拍相机所导致的平面内旋转下性能退化的问题。
  • 提供一个公开的数据集,包含精确地理参考的影像、密集深度图和6-DoF位姿,以支持自主航拍导航的研究。
  • 评估旋转鲁棒描述符(RoRD)在航拍VPR和VL场景中相对于标准全局和局部描述符的有效性。
  • 指出当前现成技术如NetVLAD和SIFT在航拍环境中的局限性,并倡导未来系统中采用旋转鲁棒且高效的描述符。

提出的方法

  • 从一架在地面上方300–400米高度飞行的轻型飞机上采集航拍影像,覆盖107公里长的轨迹,涵盖城市、农业和林地区域。
  • 将每个查询图像与使用公开地理空间数据(如OpenStreetMap、SRTM)生成的高分辨率地理参考渲染图和密集深度图配对。
  • 在VPR和VL任务中均使用Parihar等人[20]提出的旋转鲁棒局部描述符(RoRD),以更好地处理平面内旋转。
  • 在VPR中,使用局部描述符检索top-k最近邻,并根据特征频率对参考图像进行排序;使用100米距离阈值评估Recall@n。
  • 在VL中,通过RoRD建立2D-2D匹配,利用密集深度图将2D关键点反投影至3D,并通过PnP求解器最小化重投影误差来估计6-DoF位姿。
  • 将RoRD与基线方法进行比较:在VPR中使用NetVLAD(全局描述符),在VL中使用SIFT和D2-Net(局部描述符),并采用标准指标(Recall@n,绝对位姿误差)进行评估。

实验结果

研究问题

  • RQ1在高海拔向下视角航拍相机引入的极端视点变化(尤其是平面内旋转)下,标准VPR和VL技术表现如何?
  • RQ2与非旋转鲁棒或全局描述符相比,使用旋转鲁棒局部描述符(RoRD)在航拍环境中在多大程度上提升了VPR和VL的性能?
  • RQ3场景类型(城市、农业、林地)如何影响高海拔航拍场景中VPR和VL系统的性能?
  • RQ4与局部描述符流程相比,现成的全局描述符如NetVLAD在大规模航拍VPR中能否有效应对外观和视点变化?
  • RQ5查询图像与参考图像之间的平面内旋转差异对VPR精度的影响是什么?RoRD如何缓解这种性能下降?

主要发现

  • 基于RoRD的VPR在相同数据集上实现了38.7%的Recall@1,显著优于NetVLAD的10.2%,表明其在大规模航拍VPR中的优越性能。
  • 在城市场景中,RoRD-VPR的Recall@5达到77.4%,而NetVLAD仅为31.1%,表明其对外观和视点变化具有强鲁棒性。
  • 在控制航向差异的情况下,RoRD-VPR保持强性能:在135°平面内旋转下,Recall@5为51.2%,而NetVLAD下降至17.7%,凸显其旋转鲁棒性。
  • RoRD-VL在25米/5°绝对位姿误差阈值下实现了10.6%的成功率,优于SIFT(6.2%)和D2-Net(2.9%),证明其在6-DoF位姿估计中的有效性。
  • RoRD与非旋转鲁棒方法(如D2-Net和SIFT)之间的性能差距凸显了在航拍视觉定位中采用旋转不变特征的迫切需求。
  • 尽管计算成本更高,RoRD流程表明,在具有旋转和外观变化的挑战性航拍场景中,基于局部描述符的VPR可超越全局描述符如NetVLAD。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。