Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained deep neural network architecture search for IoT devices accounting hardware calibration

Florian Scheidegger, Luca Benini|arXiv (Cornell University)|2019. 09. 24.
Advanced Neural Network Applications참고 문헌 40인용 수 7
한 줄 요약

이 논문은 IoT 기기의 엄격한 메모리 및 추론 시간 제약 조건 하에서 효율적이고 저지연의 딥러닝 모델을 생성하는 좁은 공간 신경망 아키텍처 탐색 프레임워크를 제안한다. 대규모 모델로부터의 지식 정복을 활용하고 감소된 정밀도 형식(단정밀도 및 사용자 정의 8비트 유형)을 탐색함으로써, $35 라즈베리 파이 3에서 10ms 이내의 추론 시간으로 CIFAR-10에서 83.45%의 상위-1 정확도를 달성하며, 기존 모델보다 메모리 제약 조건 하에서 7퍼센트 이상 뛰어난 성능을 보였다.

ABSTRACT

Deep neural networks achieve outstanding results in challenging image classification tasks. However, the design of network topologies is a complex task and the research community makes a constant effort in discovering top-accuracy topologies, either manually or employing expensive architecture searches. In this work, we propose a unique narrow-space architecture search that focuses on delivering low-cost and fast executing networks that respect strict memory and time requirements typical of Internet-of-Things (IoT) near-sensor computing platforms. Our approach provides solutions with classification latencies below 10ms running on a $35 device with 1GB RAM and 5.6GFLOPS peak performance. The narrow-space search of floating-point models improves the accuracy on CIFAR10 of an established IoT model from 70.64% to 74.87% respecting the same memory constraints. We further improve the accuracy to 82.07% by including 16-bit half types and we obtain the best accuracy of 83.45% by extending the search with model optimized IEEE 754 reduced types. To the best of our knowledge, we are the first that empirically demonstrate on over 3000 trained models that running with reduced precision pushes the Pareto optimal front by a wide margin. Under a given memory constraint, accuracy is improved by over 7% points for half and over 1% points further for running with the best model individual format.

연구 동기 및 목표

  • IoT 엣지 기기에서 흔히 볼 수 있는 엄격한 메모리 및 지연 제약 조건을 충족하는 딥 뉴럴 네트워크를 설계하기 위해.
  • 모델 크기나 계산 비용을 증가시키지 않고도 저자원 IoT 플랫폼의 정확도를 향상시키기 위해.
  • 감소된 정밀도 산술(FP16, 8비트 유형)이 모델 정확도와 효율성에 미치는 영향을 체계적으로 평가하기 위해.
  • 새로운 하드웨어 및 네트워크 패턴에 적응할 수 있는 모듈식이고 확장 가능한 아키텍처 탐색 파이프라인을 개발하기 위해.
  • 감소된 정밀도가 모델 정확도와 효율성 간의 트레이드오���에서 파레토 최적 곡선을 어떻게 이동시키는지 경험적으로 입증하기 위해.

제안 방법

  • 기본 탐색 공간을 대규모 기준 모델에서 유도한 후, 제한된 샘플링 법칙을 적용하여 작은 효율적인 아키텍처의 집합을 생성함으로써 좁은 공간 아키텍처 탐색을 수행한다.
  • 큰 기준 모델에서 작은 후보 아키텍처로 지식을 이전하기 위해 지식 정복을 사용하여, 완전 재학습 없이도 높은 정확도를 달성한다.
  • 모든 생성된 모델이 사용자가 정의한 메모리 예산에 맞고 지연 요구 조건을 충족하도록 탐색 공간을 제약한다.
  • 감소된 정밀도 형식(FP16, 사용자 정의 8비트 유형)을 3,000개 이상의 모델에 걸쳐 체계적으로 평가하여 각 레이어에 최적의 정밀도를 식별한다.
  • 탐색 공간을 균일하게 탐색하기 위해 자동 탐색 알고리즘을 사용하고, 비교 및 검증을 위해 수동 샘플링 법칙도 사용한다.
  • 최종 모델은 CIFAR-10에서 훈련 및 평가되며, 추론 지연은 라즈베리 파이 3(B+)에서 측정되어 실제 성능을 검증한다.

실험 결과

연구 질문

  • RQ1좁은 공간 아키텍처 탐색은 IoT 기기의 엄격한 메모리 및 지연 제약 조건을 충족하면서도 높은 정확도를 달성하는 모델을 생성할 수 있는가?
  • RQ2감소된 정밀도 산술(FP16, 8비트 유형)은 작은 신경망에서 정확도와 효율성 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ3큰 기준 모델에서의 지식 정복은 완전 재학습 없이도 제약 조건이 있는 작은 모델의 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4풀 정밀도 대비 감소된 정밀도 추론을 사용할 경우, 모델 정확도와 크기의 파레토 최적 곡선이 얼마나 크게 이동하는가?
  • RQ5제안된 탐색 프레임워크는 다양한 데이터셋과 하드웨어 제약 조건에 걸쳐 효과적으로 확장될 수 있는가, 동시에 높은 효율성과 정확도를 유지하는가?

주요 결과

  • 좁은 공간 아키텍처 탐색을 통해 동일한 메모리 제약 조건 하에서 기존 IoT 모델의 70.64%에서 74.87%로 CIFAR-10 상위-1 정확도가 향상되었다.
  • 16비트 단정밀도(FP16)를 사용함으로써 동일한 메모리 제약 조건 하에서 정확도가 82.07%로 상승하여, 풀 정밀도 모델 대비 뚜렷한 향상을 보였다.
  • 각 모델가 자체 최적화된 감소된 정밀도 형식(예: 8비트 유형)을 허용함으로써 정확도는 83.45%에 도달하였으며, 이는 해당 모델 크기 및 제약 조건에서 보고된 바 가장 높은 수준이다.
  • FP16를 사용할 경우 파레토 최적 곡선이 7퍼센트 이상 향상되었고, 모델별 감소된 정밀도 유형을 사용할 경우 추가로 1% 향상되었다.
  • 라즈베리 파이 3(B+)에서 추론 지연은 항상 10ms 이내였으며, 1GB RAM과 5.6 GFLOPS 최대 성능을 가진 $35 기기에서 실시간 실행 가능성을 확인했다.
  • 이 방법은 13개의 데이터셋과 세 가지 지연 제약 조건(10³, 10⁴, 10⁵)에 걸쳐 효과적으로 확장되었으며, 각 제약 조건 하에서 최고 성능을 보이는 모델이 고정밀도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.