[논문 리뷰] Squeezed Edge YOLO: Onboard Object Detection on Edge Devices
이 논문은 자원이 제한된 엣지 디바이스를 위한 최적화된 고도로 압축된 YOLO 기반 객체 검출 모델인 Squeezed Edge YOLO를 제안한다. 하드웨어 인지 양자화와 아키텍처 프루닝을 적용하여 모델의 파라미터 수를 931K(여기서 YOLOv5s보다 8배 작다)로 줄였으며, NVIDIA Jetson Nano에서 에너지 효율성을 76% 향상시키고 처리량을 3.3배 빠르게 했으며, 극한의 메모리 제약 조건에도 불구하고 GAP8 프로세서에 성공적으로 구현하였다.
Demand for efficient onboard object detection is increasing due to its key role in autonomous navigation. However, deploying object detection models such as YOLO on resource constrained edge devices is challenging due to the high computational requirements of such models. In this paper, an compressed object detection model named Squeezed Edge YOLO is examined. This model is compressed and optimized to kilobytes of parameters in order to fit onboard such edge devices. To evaluate Squeezed Edge YOLO, two use cases - human and shape detection - are used to show the model accuracy and performance. Moreover, the model is deployed onboard a GAP8 processor with 8 RISC-V cores and an NVIDIA Jetson Nano with 4GB of memory. Experimental results show Squeezed Edge YOLO model size is optimized by a factor of 8x which leads to 76% improvements in energy efficiency and 3.3x faster throughout.
연구 동기 및 목표
- GAP8 마이크로컨트롤러와 같은 매우 제약된 엣지 디바이스에서 실시간, 저전력 객체 검출을 가능하게 하기 위해.
- 메모리와 계산 능력이 제한된 엣지 하드웨어에 YOLO 기반 모델을 구현하는 데 도전하는 것.
- 하드웨어 인지 압축 및 양자화 기법을 통해 모델 크기와 추론 효율성을 최적화하기 위해.
- 작은 YOLO 모델을 GAP8과 NVIDIA Jetson Nano 플랫폼 양쪽 모두에 성공적으로 배포하는 것.
- 최신 엣지 최적화 YOLO 모델들과의 에너지 효율성, 지연 시간, 처리량을 평가하고 비교하기 위해.
제안 방법
- Squeezed Edge YOLO 모델은 기반 YOLO 아키텍처를 아키텍처 프루닝과 파라미터 감소를 통해 킬로바이트 수준의 메모리 제약에 맞추어 유도한다.
- 메모리 사용량 감소와 함께, GAP8과 같은 플로ating-point 유닛이 없는 프로세서에서 실행 가능하도록 8비트 정수 양자화를 통해 모델을 압축한다.
- GreenWaves의 툴체인을 사용해 C 코드로 컴파일하고, GVSOC를 사용해 사이클 정확도 시뮬레이션을 수행하며, AI-deck을 사용해 실제 하드웨어에서의 벤치마킹을 수행한다.
- NVIDIA Jetson Nano에서는 모델을 TensorRT로 변환해 GPU 가속을 제공하고, 내장된 CPU 및 GPU 모니터링을 통해 전력 소비와 처리량을 평가한다.
- VCD 트레이스를 통해 GAP8의 L1, L2, L3 메모리 간의 메모리 계층 구조 활용도와 데이터 전송 효율성을 분석한다.
- 모델은 인간 검출 및 형상 검출 두 가지 데이터셋에서 평가되었으며, 주요 지표로 mAP와 지연 시간을 사용하였다.
실험 결과
연구 질문
- RQ18KB 이내의 파라미터로 압축된 YOLO 기반 객체 검출기가 엣지 배포에 적합한 정확도를 유지할 수 있는가?
- RQ2GAP8 프로세서에서 Squeezed Edge YOLO 모델은 더 큰 모델들 대비 에너지 효율성과 추론 지연 시간 측면에서 어떻게 성능을 발휘하는가?
- RQ3Jetson Nano에서 Squeezed Edge YOLO는 EdgeYOLO [10] 대비 처리량과 에너지 효율성 측면에서 어떤 성능 향상을 보이는가?
- RQ4하드웨어 인지 모델 압축은 초저전력 엣지 디바이스에서 메모리 계층 구조 활용도를 얼마나 향상시키는가?
- RQ57.5MB(8비트) 및 931K 파라미터로 줄어든 모델이 높은 정확도(mAP > 0.95)를 유지할 수 있는가?
주요 결과
- Squeezed Edge YOLO는 모델 크기를 7.5MB(8비트) 및 931K 파라미터로 압축하여 YOLOv5s 대비 8배의 압축 비율을 달성하였다.
- Jetson Nano에서 에너지 효율성이 76% 향상되어, 추론 당 에너지 소비량이 1068 mJ에서 251.5 mJ로 감소하였다.
- Jetson Nano에서 처리량은 14.2 인퍼런스/초로 증가하여 EdgeYOLO의 4.2 인퍼런스/초 대비 3.3배 빨라졌다.
- 이전에 스택 오버플로우와 메모리 제약으로 인해 EdgeYOLO를 실행하지 못했던 GAP8 프로세서에 성공적으로 배포되었다.
- VCD 트레이스 분석 결과, 더 큰 버전 대비 더 느린 L3 메모리 의존도를 최소화하여 효율적인 메모리 계층 구조 활용이 이루어졌다.
- Jetson Nano에서 Squeezed Edge YOLO는 GPU 전력 소비가 2434 mW, CPU 전력 소비가 1158 mW로, EdgeYOLO의 3846 mW 및 777 mW보다 유의미하게 낮았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.