Skip to main content
QUICK REVIEW

[论文解读] eSLAM: An Energy-Efficient Accelerator for Real-Time ORB-SLAM on FPGA Platform

Runze Liu, Jianlei Yang|arXiv (Cornell University)|Jun 3, 2019
Robotics and Sensor-Based Localization参考文献 9被引用 5
一句话总结

eSLAM 提出了一种基于异构 FPGA 的加速器,用于实时 ORB-SLAM,采用硬件友好的旋转对称 BRIEF 描述符以优化特征提取与匹配。在 TUM 数据集上,其性能相比 Intel i7 实现最高 3 倍加速,能效提升 71 倍;相比 ARM Cortex-A9 实现 31 倍加速,能效提升 25 倍。

ABSTRACT

Simultaneous Localization and Mapping (SLAM) is a critical task for autonomous navigation. However, due to the computational complexity of SLAM algorithms, it is very difficult to achieve real-time implementation on low-power platforms.We propose an energy efficient architecture for real-time ORB (Oriented-FAST and Rotated- BRIEF) based visual SLAM system by accelerating the most time consuming stages of feature extraction and matching on FPGA platform.Moreover, the original ORB descriptor pattern is reformed as a rotational symmetric manner which is much more hardware friendly. Optimizations including rescheduling and parallelizing are further utilized to improve the throughput and reduce the memory footprint. Compared with Intel i7 and ARM Cortex-A9 CPUs on TUM dataset, our FPGA realization achieves up to 3X and 31X frame rate improvement, as well as up to 71X and 25X energy efficiency improvement, respectively.

研究动机与目标

  • 解决在无人机和移动机器人等嵌入式平台实现实时、低功耗视觉 SLAM 的挑战。
  • 克服视觉 SLAM 系统中 ORB 特征提取与匹配的计算瓶颈。
  • 设计一种硬件优化的 ORB-SLAM 架构,实现在 FPGA 上的高吞吐量与低内存占用。
  • 相比 ARM 和 Intel 平台上的 CPU 实现,提升能效与帧率。
  • 通过 FPGA 加速,实现 ORB-SLAM 在资源受限自主系统中的实际部署。

提出的方法

  • 将 BRIEF 描述符重新设计为旋转对称模式,以增强硬件友好性并简化在 FPGA 上的实现。
  • 为特征提取与匹配实现流水线化、并行化与调度重排的数据流,以最大化吞吐量并最小化延迟。
  • 将最计算密集的阶段——特征提取与匹配——卸载至 FPGA 加速器,而姿态估计与地图更新则在 ARM 处理器上运行。
  • 通过数据流重排与并行处理优化内存访问模式,减少内存占用。
  • 采用四层图像金字塔实现尺度不变性,对额外图像层进行硬件感知处理以保持性能。
  • 将加速器集成至 Zynq FPGA 平台上的异构系统,结合 ARM 处理与 FPGA 加速,实现端到端实时 SLAM。

实验结果

研究问题

  • RQ1如何在低功耗 FPGA 平台上高效加速 ORB-SLAM,以实现实时性能?
  • RQ2对 ORB 描述符模式进行哪些硬件友好的修改,可显著降低计算复杂度并提升 FPGA 实现效率?
  • RQ3在 FPGA 上,调度重排与并行化在多大程度上可提升 ORB-SLAM 管道的吞吐量并减少内存占用?
  • RQ4与 ARM 和 Intel 平台上的 CPU 实现相比,所提出的 eSLAM 加速器在帧率与能效方面表现如何?
  • RQ5异构 FPGA-ARM 架构是否能在保持对运动与光照变化鲁棒性的同时,实现高能效的实时 SLAM?

主要发现

  • 在 TUM 数据集上,eSLAM 对普通帧实现 55.87 fps 的帧率,对关键帧实现 31.45 fps,相比 ARM Cortex-A9 提升 31 倍,相比 Intel i7 最高提升 3 倍。
  • 每帧能耗相比 ARM 降低 25 倍,相比 Intel i7 降低 71 倍,展现出卓越的能效优势。
  • 特征提取延迟降低至 9.1 ms,相比 ARM 提升 32 倍,相比 Intel i7 提升 3.6 倍。
  • 特征匹配延迟降低至 4.0 ms,相比 ARM 提升 61.6 倍,相比 Intel i7 提升 4.9 倍。
  • 尽管因扩展图像金字塔处理了多 48% 的像素,eSLAM 的特征提取延迟仍比先前的 FPGA ORB 提取器低 39%,归功于硬件感知优化。
  • 所提出的旋转对称 BRIEF 模式可实现更高效的硬件映射,降低复杂度并提升吞吐量,同时不牺牲描述符的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。