Skip to main content
QUICK REVIEW

[논문 리뷰] YOLO Nano: a Highly Compact You Only Look Once Convolutional Neural Network for Object Detection

Alexander Wong, Mahmoud Famuori|arXiv (Cornell University)|2019. 10. 02.
Advanced Neural Network Applications인용 수 4
한 줄 요약

YOLO Nano는 엣지 및 모바일 배포를 위해 설계된 매우 컴act한 인간-기계 협업 객체 검출 네트워크로, 모델 크기가 4.0MB이고 FLOPs가 4.57B에 불과함에도 불구하고 VOC 2007에서 69.1% mAP을 달성하여, 크기와 계산량을 각각 8배 이상, 34% 이상 감소시키면서도 Tiny YOLOv2와 Tiny YOLOv3를 초월하는 정확도를 확보함.

ABSTRACT

Object detection remains an active area of research in the field of computer vision, and considerable advances and successes has been achieved in this area through the design of deep convolutional neural networks for tackling object detection. Despite these successes, one of the biggest challenges to widespread deployment of such object detection networks on edge and mobile scenarios is the high computational and memory requirements. As such, there has been growing research interest in the design of efficient deep neural network architectures catered for edge and mobile usage. In this study, we introduce YOLO Nano, a highly compact deep convolutional neural network for the task of object detection. A human-machine collaborative design strategy is leveraged to create YOLO Nano, where principled network design prototyping, based on design principles from the YOLO family of single-shot object detection network architectures, is coupled with machine-driven design exploration to create a compact network with highly customized module-level macroarchitecture and microarchitecture designs tailored for the task of embedded object detection. The proposed YOLO Nano possesses a model size of ~4.0MB (>15.1x and >8.3x smaller than Tiny YOLOv2 and Tiny YOLOv3, respectively) and requires 4.57B operations for inference (>34% and ~17% lower than Tiny YOLOv2 and Tiny YOLOv3, respectively) while still achieving an mAP of ~69.1% on the VOC 2007 dataset (~12% and ~10.7% higher than Tiny YOLOv2 and Tiny YOLOv3, respectively). Experiments on inference speed and power efficiency on a Jetson AGX Xavier embedded module at different power budgets further demonstrate the efficacy of YOLO Nano for embedded scenarios.

연구 동기 및 목표

  • 메모리 및 전력 제약이 있는 엣지 및 모바일 디바이스에 대규모이고 계산 비용이 높은 객체 검출 네트워크를 구현하는 데 도전한다.
  • 크기와 속도를 위해 정확도를 희생하는 기존의 컴팩트 모델들인 Tiny YOLOv2와 Tiny YOLOv3의 한계를 극복한다.
  • 원칙적인 프로토타이핑과 기계 기반 아키텍처 탐색을 조합한 인간-기계 협업 설계 전략을 통해 매우 효율적이고 컴팩트한 객체 검출 아키텍처를 개발한다.
  • 모델 크기, 추론 속도, 정확도를 제약된 전력 예산 하에서 균형 잡힌 설계를 통해 실세계 임베디드 배포를 최적화한다.
  • 특히 Jetson AGX Xavier에서 전력 효율성과 추론 속도 측면에서 뛰어난 성능을 입증한다.

제안 방법

  • 두 단계의 인간-기계 협업 설계 전략을 활용: (1) YOLO 패밀리 설계 원칙에 기반한 원칙적인 네트워크 설계 프로토타이핑, (2) 생성 합성 기반 기계 기반 설계 탐색.
  • 매크로 및 마이크로 아키텍처 수준에서 세밀한 아키텍처 맞춤화를 가능하게 하는 고유한 검색 공간을 활용한다. 이는 고유한 모듈 조합과 레이어 수준의 설계를 포함한다.
  • 기계 기반 탐색을 통해 네트워크 내 전략적으로 경량화된 완전 연결 주의(FCN) 모듈을 통합함으로써, 유의미한 계산 오버헤드 없이 동적 특징 재보정을 가능하게 한다.
  • 다양이 가능한 아키텍처 구성 탐색을 위해 기저가 되는 DARTS 기반의 미분 가능 아키텍처 탐색(DARTS) 접근법을 사용한다. 이는 PEP 모듈, EP 모듈, FCA, 표준 1×1 및 3×3 컨볼루션을 포함한다.
  • Jetson AGX Xavier에서의 전력 인식 평가를 통해 모델 크기, FLOPs, 추론 속도를 공동 최적화함으로써 엣지 배포를 위한 설계를 수행한다.
  • FCA를 통한 채널 기반 특징 재보정을 적용한다. FCA는 두 개의 완전 연결 레이어를 사용하여 채널 간의 동적 상관관계를 학습하고, 더 높은 표현력을 갖춘 특징을 재가중한다.

실험 결과

연구 질문

  • RQ1기존 최신 기술의 초소형 모델보다 인간-기계 협업 설계 전략이 더 컴팩트하고 정확도가 높은 객체 검출 네트워크를 생성할 수 있는가?
  • RQ2매크로 및 마이크로 수준의 아키텍처 이질성은 표현력, 계산 비용, 크기 간의 균형을 얼마나 향상시킬 수 있는가?
  • RQ3경량 주의 메커니즘(예: FCA)의 통합은 초소형 네트워크에서 성능과 효율성에 어떤 영향을 미치는가?
  • RQ4제약된 전력 예산 하에서 엣지 하드웨어에서 Tiny YOLOv2와 Tiny YOLOv3보다 뛰어난 정확도와 효율성을 달성할 수 있는가?
  • RQ5Jetson AGX Xavier와 같은 임베디드 플랫폼에서 제안된 네트워크의 실제 추론 속도와 전력 효율성은 어떠한가?

주요 결과

  • YOLO Nano는 모델 크기가 4.0MB로, Tiny YOLOv2(60.5MB)보다 15배 이상 작고, Tiny YOLOv3(33.4MB)보다 8배 이상 작다.
  • 추론에 필요한 FLOPs는 4.57억으로, Tiny YOLOv2(6.97B FLOPs) 대비 34% 감소하고, Tiny YOLOv3(5.52B FLOPs) 대비 17% 감소하였다.
  • VOC 2007 테스트 세트에서 YOLO Nano는 69.1% mAP을 기록하였으며, 이는 Tiny YOLOv2(57.1%)보다 12% 높고, Tiny YOLOv3(58.4%)보다 10.7% 높은 성능이다.
  • Jetson AGX Xavier에서 YOLO Nano는 15W에서 26.9 FPS, 30W에서 48.2 FPS를 기록하였으며, 전력 효율성은 각각 1.97 및 1.61 이미지/sec/와트였다.
  • 기계 기반 설계 과정은 모듈 간에 고유한 매크로 및 마이크로 아키텍처를 가진 매우 이질적인 아키텍처를 성공적으로 생성하여 복잡성과 표현력 간 최적의 트레이드오���을 가능하게 하였다.
  • 자동 탐색을 통해 전략적으로 경량 완전 연결 주의(FCA) 모듈을 통합함으로써 특징 재보정이 향상되었고, 계산 비용 증가 없이 정확도 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.