[论文解读] An Energy-Efficient Quad-Camera Visual System for Autonomous Machines on FPGA Platform
本论文提出了一种面向实时自主机器定位的能效高效FPGA四摄像头视觉系统,利用硬件同步、帧复用和并行化ORB特征提取与匹配技术。与Nvidia TX1相比,其速度提升5.6倍,功耗降低3.0倍;与Intel i7相比,速度提升3.4倍,能效提升34.6倍,实现了低延迟、高可靠性的360°感知,适用于边缘计算应用。
In our past few years' of commercial deployment experiences, we identify localization as a critical task in autonomous machine applications, and a great acceleration target. In this paper, based on the observation that the visual frontend is a major performance and energy consumption bottleneck, we present our design and implementation of an energy-efficient hardware architecture for ORB (Oriented-Fast and Rotated- BRIEF) based localization system on FPGAs. To support our multi-sensor autonomous machine localization system, we present hardware synchronization, frame-multiplexing, and parallelization techniques, which are integrated in our design. Compared to Nvidia TX1 and Intel i7, our FPGA-based implementation achieves 5.6x and 3.4x speedup, as well as 3.0x and 34.6x power reduction, respectively.
研究动机与目标
- 为解决自主机器定位系统中视觉前端作为主要性能与功耗瓶颈的问题。
- 设计一种低功耗、实时的多摄像头360°感知视觉系统,适用于资源受限的FPGA平台。
- 通过全向球面覆盖与重叠帧区域,实现可靠、抗故障的定位。
- 协同优化硬件以实现基于ORB的特征提取与匹配,最大限度降低延迟与功耗。
- 通过新型硬件同步方案,支持多摄像头与IMU的集成,实现鲁棒的视觉-惯性里程计。
提出的方法
- 通过硬件同步实现多摄像头与IMU数据流的微秒级精度对齐,确保传感器间的时间一致性。
- 采用帧复用技术,将单个ORB特征提取器在左右立体帧之间时分复用,使硬件资源使用减少33%。
- 在四个摄像头通道及特征处理阶段应用并行化与流水线处理,以最大化吞吐量并最小化延迟。
- 对特征匹配器实施字长优化,以减少资源占用,同时保持精度。
- 协同设计统一的基于ORB的视觉前端,实现特征提取与匹配,通过立体对之间的逻辑共享降低面积开销。
- 系统在Xilinx Zynq Ultrascale+ FPGA上实现,配备自定义控制逻辑,用于动态资源分配与数据流管理。
实验结果
研究问题
- RQ1FPGA-based视觉系统如何在多摄像头自主定位中实现实时性能与低功耗?
- RQ2哪些硬件技术能有效降低基于ORB的特征提取与匹配中的资源使用,同时保持高精度?
- RQ3如何实现四摄像头与IMU之间的硬件同步,以确保可靠的视觉-惯性里程计?
- RQ4帧复用与并行化在多传感器视觉系统中,能在多大程度上提升吞吐量与能效?
- RQ5在真实世界的定位工作负载中,所提出的系统与GPU和CPU实现相比,在性能与能效方面表现如何?
主要发现
- FPGA系统在640×480分辨率下实现69 fps,相比Nvidia TX1提升5.63倍,相比Intel i7 CPU提升3.38倍。
- 在640×480分辨率下功耗降低至1.63 W,相比Nvidia TX1能效提升3.03倍,相比Intel i7能效提升34.63倍。
- FPGA上的特征提取与匹配精度与软件实现相比误差仅0.3%,所有指标的坐标精度达96.8%至99.7%。
- 资源利用率高效:640×480处理仅使用51% LUTs、12%触发器、30% BRAMs,以及仅1% DSPs。
- 系统支持无故障风险的360°感知,因为连续帧之间始终存在重叠区域。
- 与先前的FPGA加速器相比,本设计在速度上提升1.23倍,功耗降低16%(优于[7]),且功耗较[4]降低64%,同时支持立体视觉深度与多摄像头输入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。