[논문 리뷰] Memory-Driven Mixed Low Precision Quantization For Enabling Deep Network Inference On Microcontrollers
이 논문은 메모리 주도 혼합-정밀도 양자화 방법과 Integer Channel-Normalization (ICN) 활성화를 제안하여 마이크로컨트롤러에서 엔드투엔드 정수-전용 심층 네트워크 추론을 가능하게 하며, 2MB Flash와 512kB RAM을 가진 STM32H7에서 68% Top1을 달성하고, 이전 8비트 방법보다 8% 높다.
This paper presents a novel end-to-end methodology for enabling the deployment of low-error deep networks on microcontrollers. To fit the memory and computational limitations of resource-constrained edge-devices, we exploit mixed low-bitwidth compression, featuring 8, 4 or 2-bit uniform quantization, and we model the inference graph with integer-only operations. Our approach aims at determining the minimum bit precision of every activation and weight tensor given the memory constraints of a device. This is achieved through a rule-based iterative procedure, which cuts the number of bits of the most memory-demanding layers, aiming at meeting the memory constraints. After a quantization-aware retraining step, the fake-quantized graph is converted into an inference integer-only model by inserting the Integer Channel-Normalization (ICN) layers, which introduce a negligible loss as demonstrated on INT4 MobilenetV1 models. We report the latency-accuracy evaluation of mixed-precision MobilenetV1 family networks on a STM32H7 microcontroller. Our experimental results demonstrate an end-to-end deployment of an integer-only Mobilenet network with Top1 accuracy of 68% on a device with only 2MB of FLASH memory and 512kB of RAM, improving by 8% the Top1 accuracy with respect to previously published 8 bit implementations for microcontrollers.
연구 동기 및 목표
- 장치 메모리 제약 하에서 각 활성화 및 가중치 텐서에 대해 최소 비트 정밀도를 자동으로 선택한다.
- 혼합 정밀도 양자화를 통해 마이크로컨트롤러에서 엔드투엔드 정수-전용 추론을 가능하게 한다.
- 서브 바이트, 채널 단위 양자화를 지원하기 위해 Integer Channel-Normalization (ICN) 활성화를 도입한다.
- 엄격한 메모리 예산에서 STM32H7 MCU상 MobilenetV1 패밀리에 대한 지연-정확도 트레이드오프를 시연한다.
제안 방법
- 활성화와 가중치에 대해 8, 4, 또는 2비트 균일 양자화를 사용하는 혼합 정밀도 양자화를 이용한다.
- 메모리 제약을 만족시키기 위해 정수-전용 연산으로 추론을 모델링하고 규칙 기반의 반복 절차를 적용한다.
- fake-quantized 그래프를 정수-전용 배치로 변환하기 위해 Integer Channel-Normalization (ICN) 계층을 도입하고 적용한다.
- 양자화 후 정확도를 회복하기 위해 양자화 인식 재학습을 수행한다.
- 채널 단위 양자화를 지원하고 정확도 붕괴를 방지하기 위해 배치 정규화 매개변수를 가중치에 접어넣는 것을 피한다.
- CMSIS-NN 최적화를 적용한 STM32H7에서 실행되는 MobilenetV1 패밀리에 대한 지연-정확도를 평가한다.
실험 결과
연구 질문
- RQ1메모리 제약이 있는 마이크로컨트롤러가 혼합 정밀도 양자화를 통해 엔드투엔드 정수형 심층 네트워크를 지원할 수 있는가?
- RQ2정확도를 보존하면서 장치 메모리 제약을 만족하도록 텐서별 비트 폭을 자동으로 할당하는 방법은?
- RQ3서브바이트 양자화에서 정확도와 배포 가능성에 대한 Integer Channel-Normalization (ICN)의 영향은?
- RQ4MCU 대상에서 채널별 ICN이 계층별 양자화에 비해 정확도와 메모리 점유 측면에서 어떻게 비교되는가?
주요 결과
- STM32H7 (2MB Flash, 512kB RAM)에서 엔드투엔드 정수형 MobilenetV1 배치를 달성하면 68% Top1 정확도이다.
- 해당 68% 모델은 마이크로컨트롤러용으로 이전에 발표된 8비트 정수형 전용 구현보다 8% 높다.
- PL+ICN INT4는 BN 접힘으로 인한 정확도 붕괴를 방지하고, PL+FB INT4가 붕괴하는 곳에서 학습 수렴을 가능하게 한다.
- PC+ICN INT4는 약 2.12 MB의 메모리 풋프린트에서 66.41% Top1 정확도를 얻어 ICN과 채널별 양자화의 이점을 시연한다.
- MixQ-PC-ICN 구성은 Pareto 최적의 정확도-지연 트레이드오프를 제공하며, PC+ICN은 MixQ-PL에 비해 약간의 지연 오버헤드(~20%)로 더 높은 정확도를 달성한다.
- 2MB ROM / 512kB RAM 예산에서 일부 구성은 최대 68% Top1 정확도를 달성하여 비슷한 제약 하의 여러 이전 혼합 정밀도 접근법보다 성능이 우수하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.