Skip to main content
QUICK REVIEW

[논문 리뷰] FLightNNs: Lightweight Quantized Deep Neural Networks for Fast and Accurate Inference

Ruizhou Ding, Zeye Liu|arXiv (Cornell University)|2019. 04. 05.
Advanced Neural Network Applications참고 문헌 1인용 수 8
한 줄 요약

FLightNN은 경량화된 양자화 신경망에서 각 필터별로 미분 가능한 k값 선택 메커니즘을 도입하여, 각 컨볼루션 필터당 시프트-애드 연산 수(k ∈ {1,2})를 동적으로 최적화한다. 이는 정확도-지연-에너지 간의 연속적인 트레이드오���을 가능하게 하며, 고정 k값을 사용하는 LightNN보다 최대 2배의 속도 향상을 이끌어내며 정확도 저하가 0.1%에 불과하고, FPGA 및 ASIC 플랫폼에서 4비트 고정점 양자화보다도 빠르고 정확도가 높다.

ABSTRACT

To improve the throughput and energy efficiency of Deep Neural Networks (DNNs) on customized hardware, lightweight neural networks constrain the weights of DNNs to be a limited combination (denoted as $k\in\{1,2\}$) of powers of 2. In such networks, the multiply-accumulate operation can be replaced with a single shift operation, or two shifts and an add operation. To provide even more design flexibility, the $k$ for each convolutional filter can be optimally chosen instead of being fixed for every filter. In this paper, we formulate the selection of $k$ to be differentiable, and describe model training for determining $k$-based weights on a per-filter basis. Over 46 FPGA-design experiments involving eight configurations and four data sets reveal that lightweight neural networks with a flexible $k$ value (dubbed FLightNNs) fully utilize the hardware resources on Field Programmable Gate Arrays (FPGAs), our experimental results show that FLightNNs can achieve 2$ imes$ speedup when compared to lightweight NNs with $k=2$, with only 0.1\% accuracy degradation. Compared to a 4-bit fixed-point quantization, FLightNNs achieve higher accuracy and up to 2$ imes$ inference speedup, due to their lightweight shift operations. In addition, our experiments also demonstrate that FLightNNs can achieve higher computational energy efficiency for ASIC implementation.

연구 동기 및 목표

  • 기존의 경량화된 양자화 네트워크인 LightNN-1 및 LightNN-2와 같이 정확도, 지연, 에너지 효율성 간의 이산적인 파레토 프론트를 해결하기 위함.
  • 더 유연하고 연속적인 하드웨어 자원 트레이드오프를 위해 각 필터별로 시프트-애드 연산 수(k ∈ {1,2})를 최적화할 수 있도록 하기 위함.
  • 표준 SGD를 사용하여 네트워크 가중치와 k값을 종합적으로 최적화할 수 있는 미분 가능한 훈련 방법을 개발하기 위함.
  • 고정 k값 모델 및 4비트 양자화 모델 대비 FPGA 및 ASIC 플랫폼에서 뛰어난 추론 속도, 에너지 효율성, 정확도를 확보하기 위함.

제안 방법

  • 각 컨볼루션 필터에 대한 k값 선택을 미분 가능한 최적화 문제로 설정하여, 확률적 경사 하강법(SGD)을 사용한 종단 간 훈련이 가능하도록 함.
  • 각 필터당 가속 가능한 이산적 k값 집합 {k₁, ..., k_F}를 도입하며, 여기서 각 k_i ∈ {1,2}이며, 곱셈 연산을 대체하는 데 사용되는 시프트-애드 연산 수를 제어함.
  • 백프로파게이션 중 기울기 전파를 가능하게 하기 위해 이산 k선택 과정에 대한 미분 가능한 리라크스를 도입하여, 가중치와 k값을 동시에 최적화할 수 있도록 함.
  • 피이프라인 처리 및 하드웨어 우아한 설계를 사용하여, 이로 인해 유도된 FLightNN 모델을 FPGA 및 ASIC에 구현함.
  • 통과량, 정확도, 자원 활용도 평가를 위해 여덟 가지 구성과 네 가지 데이터셋을 대상으로 광범위한 FPGA 실험을 수행함.
  • 계산 에너지 소비와 정확도 트레이드오프 평가를 위해 65nm 표준 셀 라이브러리를 사용한 ASIC 시뮬레이션을 수행함.

실험 결과

연구 질문

  • RQ1경량화된 양자화 네트워크에서 각 필터별로 k값 선택을 가능하게 하여 정확도, 지연, 에너지 효율성 간의 더 연속적이고 탄력적인 파레토 프론트를 달성할 수 있는가?
  • RQ2미분 가능한 훈련 방법이 종단 간 방식으로 네트워크 가중치와 k값(k ∈ {1,2})을 효과적으로 최적화할 수 있는가?
  • RQ3FLightNN은 FPGA 및 ASIC 플랫폼에서 고정 k값 LightNN 및 4비트 고정점 양자화 모델보다 높은 추론 속도와 에너지 효율성을 달성하는가?
  • RQ4FLightNN은 하드웨어 효율성을 유지하면서 LightNN-1 및 LightNN-2보다 정확도와 에너지 효율성 측면에서 뛰어나게 성능을 높일 수 있는가?

주요 결과

  • FPGA에서 FLightNN은 고정 k값 LightNN-2 대비 최대 2배의 속도 향상을 이끌어내며 정확도 저하가 0.1%에 불과하여 뛰어난 추론 효율성을 입증함.
  • FPGA 환경에서 FLightNN은 4비트 고정점 양자화보다 더 높은 통과량을 확보하였으며, 최대 2배의 속도 향상과 더 나은 정확도를 기록함.
  • FLightNN은 정확도 대비 에너지/지연 간의 더 연속적인 파레토 프론트를 제공하여, 테스트된 모든 데이터셋과 네트워크 아키텍처에서 LightNN-1 및 LightNN-2를 초월함.
  • ASIC 시뮬레이션 결과, FLightNN은 LightNN-1 및 LightNN-2보다 더 낮은 계산 에너지 소비를 기록하였으며, 일부 경우에서 더 높은 정확도를 확보함.
  • FLightNN은 LightNN-1 및 LightNN-2를 초월하는 정확도-저장소 파레토 프론트를 제공하여 더 넓은 유효 설계 공간을 확보함.
  • 미분 가능한 훈련 방법은 반복적 또는 히우리스틱 검색 없이도 효율적인 종단 간 최적화를 가능하게 하여 훈련 오버헤드를 감소시킴.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.