Skip to main content
QUICK REVIEW

[논문 리뷰] Deploy Large-Scale Deep Neural Networks in Resource Constrained IoT Devices with Local Quantization Region

Yi Yang, Andy Chen|arXiv (Cornell University)|2018. 05. 24.
Advanced Neural Network Applications참고 문헌 20인용 수 7
한 줄 요약

이 논문은 8비트에서 1비트까지의 저비트 정밀도를 사용하여 자원이 제한된 IoT 기기에서 대규모 딥 뉴럴 네트워크를 구현하기 위해 국소 양자화 영역(LQR) 방법을 제안한다. 최소한의 정확도 손실(예: 2비트에서 상위 1위 정확도 손실 0.7%)로 정확한 모델 추론을 가능하게 하며, 인텔 에드슨에서 최대 2배의 속도 향상을 달성함으로써, 스킴-매핑 연산의 효율적인 테이블 룩업 대체를 통해 저비용 하드웨어에서 고복잡도 모델의 구현 가능성을 높인다.

ABSTRACT

Implementing large-scale deep neural networks with high computational complexity on low-cost IoT devices may inevitably be constrained by limited computation resource, making the devices hard to respond in real-time. This disjunction makes the state-of-art deep learning algorithms, i.e. CNN (Convolutional Neural Networks), incompatible with IoT world. We present a low-bit (range from 8-bit to 1-bit) scheme with our local quantization region algorithm. We use models in Caffe model zoo as our example tasks to evaluate the effect of our low precision data representation scheme. With the available of local quantization region, we find implementations on top of those schemes could greatly retain the model accuracy, besides the reduction of computational complexity. For example, our 8-bit scheme has no drops on top-1 and top-5 accuracy with 2x speedup on Intel Edison IoT platform. Implementations based on our 4-bit, 2-bit or 1-bit scheme are also applicable to IoT devices with advances of low computational complexity. For example, the drop on our task is only 0.7% when using 2-bit scheme, a scheme which could largely save transistors. Making low-bit scheme usable here opens a new door for further optimization on commodity IoT controller, i.e. extra speed-up could be achieved by replacing multiply-accumulate operations with the proposed table look-up operations. The whole study offers a new approach to relief the challenge of bring advanced deep learning algorithm to resource constrained low-cost IoT device.

연구 동기 및 목표

  • 저비용이며 자원이 제한된 IoT 기기에서 고복잡도 딥 뉴럴 네트워크를 구현하는 데 도전하는 문제를 해결하기 위해.
  • 정확도가 크게 떨어지지 않도록 딥 러닝 추론의 계산 복잡도와 메모리 사용량을 줄이기 위해.
  • 일반적인 IoT 컨트롤러에서 엣지 AI를 위한 실용적인 솔루션으로서 8비트에서 1비트까지의 저비트 양자화를 가능하게 하기 위해.
  • 더 빠른 속도 향상을 위해 승법-가산 연산을 테이블 룩업으로 대체할 수 있는지 탐색하기 위해.
  • 실제 IoT 플랫폼인 인텔 에드슨과 같은 환경에서 저정밀도 모델의 실용적 적용 가능성을 입증하기 위해.

제안 방법

  • 각 레이어 또는 특징 맵별로 양자화를 적응시키는 국소 양자화 영역(LQR) 알고리즘을 도입하여 전역 양자화보다 정밀도를 향상시킨다.
  • 모델 크기와 계산 비용을 줄이기 위해 8비트, 4비트, 2비트, 1비트의 저비트 표현을 사용한다.
  • 추론 파이프라인에서 표준 승법-가산(MAC) 연산을 효율적인 테이블 룩업으로 대체한다.
  • 실제 응용에 부합하는지를 보장하기 위해 Caffe 모델 라이브러리의 사전 훈련된 모델을 대상으로 평가한다.
  • 정확도 손실을 최소화하면서 하드웨어 효율성을 극대화하기 위해 양자화 과정을 최적화한다.
  • 실시간 성능과 속도 향상을 검증하기 위해 인텔 에드슨 플랫폼에 이 방법을 구현한다.

실험 결과

연구 질문

  • RQ1국소 양자화 영역을 사용한 저비트 양자화가 자원이 제한된 IoT 기기에서 높은 모델 정확도를 유지할 수 있는가?
  • RQ28비트 이하의 정밀도 표현을 사용할 경우 계산 복잡도를 얼마나 줄일 수 있는가?
  • RQ3다양한 비트 폭에서 LQR 방법이 전역 양자화와 비교해 모델 정확도 유지에 얼마나 효과적인가?
  • RQ4테이블 룩업 기반 추론이 저성능 하드웨어에서 MAC 연산을 대체하여 상당한 속도 향상을 달성할 수 있는가?
  • RQ51비트 또는 2비트 양자화를 사용할 경우 정확도와 계산 효율성 사이의 상충 관계는 어떠한가?

주요 결과

  • 8비트 양자화 방식은 인텔 에드슨 플랫폼에서 상위 1위 및 상위 5위 정확도를 유지하면서 2배의 속도 향상을 달성한다.
  • 2비트 양자화 방식은 상위 1위 정확도 손실이 오직 0.7%에 불과하여 저정밀도 배포에 매우 실용적임을 입증한다.
  • 제안된 방법은 MAC 연산을 테이블 룩업으로 대체함으로써 일반적인 IoT 컨트롤러에서 효율적인 추론을 가능하게 한다.
  • 4비트, 2비트, 1비트의 저비트 체계는 계산 복잡도를 크게 줄이면서도 모델의 유용성을 유지한다.
  • 국소 데이터 분포에 적응함으로써 전역 양자화보다 우수한 정확도 유지 성능을 보이며, 정확도를 보존한다.
  • 이 방법은 성능을 희생시키지 않고 저비용 IoT 기기에서 대규모 딥 뉴럴 네트워크의 실용적 배포를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.