Skip to main content
QUICK REVIEW

[论文解读] Squeezed Edge YOLO: Onboard Object Detection on Edge Devices

Edward Humes, Mozhgan Navardi|arXiv (Cornell University)|Dec 18, 2023
Advanced Neural Network Applications被引用 5
一句话总结

本文提出 Squeezed Edge YOLO,一种高度压缩的基于 YOLO 的目标检测模型,专为资源受限的边缘设备优化。通过应用硬件感知量化和结构剪枝,模型将参数量减少至 931K(比 YOLOv5s 小 8 倍),在 NVIDIA Jetson Nano 上实现 76% 的能效提升和 3.3 倍的吞吐量加速,成功部署于 GAP8 处理器,尽管面临极端内存限制。

ABSTRACT

Demand for efficient onboard object detection is increasing due to its key role in autonomous navigation. However, deploying object detection models such as YOLO on resource constrained edge devices is challenging due to the high computational requirements of such models. In this paper, an compressed object detection model named Squeezed Edge YOLO is examined. This model is compressed and optimized to kilobytes of parameters in order to fit onboard such edge devices. To evaluate Squeezed Edge YOLO, two use cases - human and shape detection - are used to show the model accuracy and performance. Moreover, the model is deployed onboard a GAP8 processor with 8 RISC-V cores and an NVIDIA Jetson Nano with 4GB of memory. Experimental results show Squeezed Edge YOLO model size is optimized by a factor of 8x which leads to 76% improvements in energy efficiency and 3.3x faster throughout.

研究动机与目标

  • 在如 GAP8 微控制器等高度受限的边缘设备上实现实时、低功耗的目标检测。
  • 解决在内存和计算能力有限的边缘硬件上部署基于 YOLO 模型的挑战。
  • 通过硬件感知压缩和量化技术优化模型大小与推理效率。
  • 在 GAP8 和 NVIDIA Jetson Nano 平台成功部署微型 YOLO 模型。
  • 与最先进的边缘优化 YOLO 模型对比评估并比较能效、延迟和吞吐量。

提出的方法

  • Squeezed Edge YOLO 模型通过结构剪枝和参数缩减,从基础 YOLO 架构衍生而来,以适配千字节级内存限制。
  • 通过 8 位整数量化实现模型压缩,以减少内存占用,并支持在无浮点单元的处理器(如 GAP8)上执行。
  • 使用 GreenWaves 工具链将模型编译为 C 代码,并通过 GVSOC 实现周期精确仿真,或在 AI-deck 上进行真实硬件基准测试。
  • 在 NVIDIA Jetson Nano 上,将模型转换为 TensorRT 以实现 GPU 加速,并通过板载 CPU 和 GPU 监控评估功耗和吞吐量。
  • 通过 VCD 轨迹分析性能,评估 GAP8 上 L1、L2 和 L3 内存之间的内存层次结构利用率和数据传输效率。
  • 在两个数据集上评估模型:行人检测和形状检测,使用 mAP 和延迟作为关键指标。

实验结果

研究问题

  • RQ1能否将基于 YOLO 的目标检测器压缩至仅 8KB 参数,同时保持适用于边缘部署的可接受准确率?
  • RQ2与更大模型相比,Squeezed Edge YOLO 在 GAP8 处理器上的能效和推理延迟表现如何?
  • RQ3在 Jetson Nano 上,Squeezed Edge YOLO 相较于 EdgeYOLO [10] 在吞吐量和能效方面有何性能提升?
  • RQ4硬件感知模型压缩在超低功耗边缘设备上对内存层次结构利用率的提升程度如何?
  • RQ5在模型被压缩至 7.5MB(8 位)和 931K 参数时,能否保持高准确率(mAP > 0.95)?

主要发现

  • Squeezed Edge YOLO 将模型大小压缩至 7.5MB(8 位)和 931K 参数,相比 YOLOv5s 实现了 8 倍的压缩率。
  • 在 Jetson Nano 上,能效提升 76%,每次推理的能耗从 1068 mJ 降低至 251.5 mJ。
  • 吞吐量提升至每秒 14.2 次推理(比 EdgeYOLO 的 4.2 次/秒快 3.3 倍)。
  • 模型成功部署于 GAP8 处理器,此前因栈溢出和内存限制而无法运行 EdgeYOLO。
  • VCD 轨迹显示内存层次结构利用高效,Squeezed Edge YOLO 相较于更大变体显著减少了对较慢 L3 内存的依赖。
  • 在 Jetson Nano 上,Squeezed Edge YOLO 消耗 2434 mW GPU 功率和 1158 mW CPU 功率,显著低于 EdgeYOLO 的 3846 mW 和 777 mW。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。