Skip to main content
QUICK REVIEW

[論文レビュー] Squeezed Edge YOLO: Onboard Object Detection on Edge Devices

Edward Humes, Mozhgan Navardi|arXiv (Cornell University)|Dec 18, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

本論文では、リソース制限のあるエッジデバイス向けに最適化された、極めてコンパクトなYOLOベースのオブジェクト検出モデル「Squeezed Edge YOLO」を提案する。ハードウェアに配慮した量子化とアーキテクチャのプルーニングを適用することで、パラメータ数を931K(YOLOv5sの8分の1)に削減し、NVIDIA Jetson Nano上で76%のエネルギー効率の向上と3.3倍の高速なスループットを達成した。また、極めて限られたメモリ制約下でもGAP8プロセッサ上への正常なデプロイが成功した。

ABSTRACT

Demand for efficient onboard object detection is increasing due to its key role in autonomous navigation. However, deploying object detection models such as YOLO on resource constrained edge devices is challenging due to the high computational requirements of such models. In this paper, an compressed object detection model named Squeezed Edge YOLO is examined. This model is compressed and optimized to kilobytes of parameters in order to fit onboard such edge devices. To evaluate Squeezed Edge YOLO, two use cases - human and shape detection - are used to show the model accuracy and performance. Moreover, the model is deployed onboard a GAP8 processor with 8 RISC-V cores and an NVIDIA Jetson Nano with 4GB of memory. Experimental results show Squeezed Edge YOLO model size is optimized by a factor of 8x which leads to 76% improvements in energy efficiency and 3.3x faster throughout.

研究の動機と目的

  • GAP8マイコンのような高度に制限されたエッジデバイス上で、リアルタイムかつ低消費電力のオブジェクト検出を可能にすること。
  • メモリ容量と計算能力に制限のあるエッジハードウェアにYOLOベースのモデルをデプロイする課題に対処すること。
  • ハードウェアに配慮した圧縮と量子化技術を用いて、モデルサイズと推論効率を最適化すること。
  • GAP8およびNVIDIA Jetson Nanoの両プラットフォーム上での、極小YOLOモデルの正常なデプロイを実証すること。
  • 最先端のエッジ最適化YOLOモデルと比較して、エネルギー効率、遅延、スループットを評価すること。

提案手法

  • Squeezed Edge YOLOモデルは、アーキテクチャのプルーニングとパラメータ削減を経て、キロバイトスケールのメモリ制約に収まるようにベースYOLOアーキテクチャから導出される。
  • モデル圧縮は8ビット整数量子化により実現され、浮動小数点ユニットのないプロセッサ(例:GAP8)でも実行可能になるようにメモリフットプリントを削減する。
  • GreenWavesのツールチェーンを用いてCコードにコンパイルし、GVSOCを用いたサイクル正確なシミュレーションおよびAI-deckを用いた実ハードウェアベンチマークでGAP8にデプロイする。
  • NVIDIA Jetson Nanoでは、モデルをTensorRTに変換してGPUアクセラレーションを活用し、統合されたCPUおよびGPUの監視機能を用いて消費電力とスループットを評価する。
  • VCDトレースを用いて、GAP8のL1、L2、L3メモリ間のメモリ階層の利用状況とデータ転送効率を分析する。
  • モデルは2つのデータセット(人検出および形状検出)で評価され、主な指標としてmAPと遅延が用いられる。

実験結果

リサーチクエスチョン

  • RQ18KBのパラメータ制限内に収まるようにYOLOベースのオブジェクト検出器を圧縮可能であり、エッジデプロイに耐えうる十分な精度を維持できるか?
  • RQ2GAP8プロセッサ上でのSqueezed Edge YOLOのエネルギー効率と推論遅延は、より大きなモデルと比較してどの程度優れているか?
  • RQ3Jetson Nano上でのSqueezed Edge YOLOは、EdgeYOLO [10] と比較して、スループットおよびエネルギー効率でどの程度の性能向上を達成するか?
  • RQ4ハードウェアに配慮したモデル圧縮は、超低消費電力エッジデバイスにおけるメモリ階層の利用状況をどの程度改善するか?
  • RQ57.5MB(8ビット)および931Kのパラメータにまで縮小されたモデルが、高い精度(mAP > 0.95)を維持できるか?

主な発見

  • Squeezed Edge YOLOは、モデルサイズを7.5MB(8ビット)および931Kのパラメータにまで削減し、YOLOv5sと比較して8倍の圧縮率を達成した。
  • Jetson Nano上では、1インスタンスあたりの消費エネルギーを1068 mJから251.5 mJに削減し、エネルギー効率が76%向上した。
  • Jetson Nano上でのスループットは14.2インスタンス/秒(EdgeYOLOの4.2インスタンス/秒と比較して3.3倍高速)に向上した。
  • GAP8プロセッサ上へのデプロイに成功した。これは、以前はスタックオーバーフローとメモリ制限のためEdgeYOLOを実行できなかったため、顕著な成果である。
  • VCDトレースの結果、Squeezed Edge YOLOは、より大きなバージョンと比較してL3メモリへの依存度を最小限に抑え、効率的なメモリ階層の利用がなされていることが示された。
  • Jetson Nano上では、Squeezed Edge YOLOはGPUで2434 mW、CPUで1158 mWの消費電力を示し、それぞれEdgeYOLOの3846 mWおよび777 mWと比較して顕著に低い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。