Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Localization And Mapping with depth Prediction using Capsule Networks for UAVs

Sunil Prakash, Gaelan Gu|arXiv (Cornell University)|Aug 16, 2018
Robotics and Sensor-Based Localization参考文献 9被引用 4
一句话总结

本文提出一种用于无人机的单目SLAM系统,利用胶囊网络(CapsNet)进行深度预测,通过编码空间层次结构和物体位姿,相较于基于CNN的方法有所改进。该系统将CapsNet生成的深度图与基于关键帧的相机位姿估计及扩展卡尔曼滤波器(EKF)相结合,在TUM数据集上实现的深度估计精度高于ORB-SLAM和CNN-SLAM,TUM/seq3序列中正确深度预测率达到29.98%。

ABSTRACT

In this paper, we propose an novel implementation of a simultaneous localization and mapping (SLAM) system based on a monocular camera from an unmanned aerial vehicle (UAV) using Depth prediction performed with Capsule Networks (CapsNet), which possess improvements over the drawbacks of the more widely-used Convolutional Neural Networks (CNN). An Extended Kalman Filter will assist in estimating the position of the UAV so that we are able to update the belief for the environment. Results will be evaluated on a benchmark dataset to portray the accuracy of our intended approach.

研究动机与目标

  • 开发一种低成本的单目SLAM系统,用于无人机,通过胶囊网络(CapsNet)进行深度预测,以克服CNN在编码空间位姿和物体方向方面的局限性。
  • 通过CapsNet对空间关系的向量化表示,提升单目相机在无人机导航中的深度估计精度。
  • 将基于CapsNet的深度图与关键帧跟踪及基于EKF的位姿估计相融合,实现鲁棒的三维环境重建。
  • 在基准数据集上评估所提方法,并与ORB-SLAM和CNN-SLAM在深度预测精度方面进行性能对比。
  • 评估在TUM数据集上训练的CapsNet模型在新、未见过的室内环境中的一般化能力。

提出的方法

  • 系统采用安装在Parrot AR Quadcopter无人机上的单目前向摄像头,配备ROS,以18fps、640x480的视频帧率进行SLAM处理。
  • CapsNet处理输入图像以生成密集的深度/视差图,通过胶囊之间的动态路由编码物体位姿和空间层次结构。
  • 采用关键帧方法检测并跟踪2D-3D对应点,利用光流和深度图约束,通过EKF估计相机位姿。
  • EKF融合深度预测结果与光流残差,采用Huber范数和基于残差的不确定性建模以最小化不确定性。
  • 通过测量像素级预测视差的置信度,生成不确定性图,以提升深度估计的鲁棒性。
  • 系统将深度图与光流和关键帧数据相融合,利用基于EKF的状态估计构建环境的全局3D地图。

实验结果

研究问题

  • RQ1胶囊网络(CapsNets)在无人机应用的单目SLAM中是否能优于卷积神经网络(CNNs)在深度预测精度方面?
  • RQ2与传统CNN相比,CapsNets中的向量化表示在空间推理和物体位姿估计方面有何改进?
  • RQ3基于CapsNet的深度预测在多大程度上提升了无人机位姿估计和3D地图重建的精度?
  • RQ4在TUM数据集上训练的模型在具有不同光照和结构特征的新、未见过的室内环境中是否具备良好的泛化能力?
  • RQ5与基于CNN或基于特征的方法相比,CapsNet深度图与EKF及关键帧跟踪的融合在多大程度上提升了整体SLAM性能?

主要发现

  • 所提出的基于CapsNet的SLAM系统在TUM/seq3数据集上实现了29.98%的正确深度预测率,优于ORB-SLAM(12.477%)和CNN-SLAM(27.396%)在该序列中的表现。
  • 在TUM/seq2上,该方法实现了25.784%的正确深度预测率,超过CNN-SLAM的24.077%和ORB-SLAM的0.059%。
  • 系统展示了良好的泛化能力,在自建的室内公寓数据集上实现了28.590%的正确深度预测率,尽管模型仅在TUM数据上进行训练。
  • 在TUM数据集的四个序列中,CapsNet的深度预测精度在三个序列中优于CNN-SLAM,表明其在空间推理和特征编码方面具有优势。
  • 基于像素置信度生成的不确定性图提升了深度估计的鲁棒性,尤其在无纹理或低对比度区域表现更优。
  • CapsNet深度图与EKF及光流的融合实现了稳定的3D建图和准确的无人机位姿估计,即使在单目约束下也能实现实时处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。