Skip to main content
QUICK REVIEW

[논문 리뷰] MSP: An FPGA-Specific Mixed-Scheme, Multi-Precision Deep Neural Network Quantization Framework

Sung-En Chang, Yanyu Li|arXiv (Cornell University)|2020. 09. 16.
Advanced Neural Network Applications참고 문헌 47인용 수 4
한 줄 요약

이 논문은 FPGA 전용 혼합 기법, 다중 정밀도 양자화 프레임워크인 MSP를 제안한다. 이는 LUT와 DSP를 동시에 활용하기 위해 합의 거듭제곱 형태(SPoT)와 고정소수점 양자화를 결합한다. 5%의 8비트 가중치를 포함한 레이어 내 다중 정밀도 양자화를 통해, ImageNet에서 70.47%의 Top1 정확도를 달성하면서 고정소수점 양자화 대비 3.53배의 속도 향상을 이룬다. 이는 정확도 손실 없이 하드웨어 활용도를 극대화한 것이다.

ABSTRACT

With the tremendous success of deep learning, there exists imminent need to deploy deep learning models onto edge devices. To tackle the limited computing and storage resources in edge devices, model compression techniques have been widely used to trim deep neural network (DNN) models for on-device inference execution. This paper targets the commonly used FPGA (field programmable gate array) devices as the hardware platforms for DNN edge computing. We focus on the DNN quantization as the main model compression technique, since DNN quantization has been of great importance for the implementations of DNN models on the hardware platforms. The novelty of this work comes in twofold: (i) We propose a mixed-scheme DNN quantization method that incorporates both the linear and non-linear number systems for quantization, with the aim to boost the utilization of the heterogeneous computing resources, i.e., LUTs (look up tables) and DSPs (digital signal processors) on an FPGA. Note that all the existing (single-scheme) quantization methods can only utilize one type of resources (either LUTs or DSPs for the MAC (multiply-accumulate) operations in deep learning computations. (ii) We use a quantization method that supports multiple precisions along the intra-layer dimension, while the existing quantization methods apply multi-precision quantization along the inter-layer dimension. The intra-layer multi-precision method can uniform the hardware configurations for different layers to reduce computation overhead and at the same time preserve the model accuracy as the inter-layer approach.

연구 동기 및 목표

  • 자원이 제한된 FPGA에 저정밀도 DNN를 효율적으로 구현하면서 높은 하드웨어 효율성과 최소한의 정확도 손실을 달성하고자 한다.
  • 단일 기법의 양자화(예: LUT 또는 DSP만 사용)의 한계를 극복하기 위해 이질적인 FPGA 자원(LUT 및 DSP)을 공동 최적화하고자 한다.
  • 레이어 간 양자화 방식 대신 레이어 내 다중 정밀도 양자화를 통해 하드웨어 구성 복잡도와 계산 오버헤드를 감소시키고자 한다.
  • 일반적으로 정밀도 손실에 민감한 첫 번째 및 마지막 레이어를 양자화하더라도 정확도 손실 없이 성능을 유지하고자 한다.
  • 혼합 정밀도 및 혼합 기법 연산을 지원하는 통합된 하드웨어 우수한 양자화 프레임워크를 제공하여 효율적인 FPGA 배포를 실현하고자 한다.

제안 방법

  • LUT를 사용해 비트 시프트와 덧셈 연산을 수행할 수 있는 합의 거듭제곱 형태(SPoT) 양자화 기법을 제안하여, DSP 의존도를 감소시키고 일반적인 거듭제곱 형태 기법 대비 정확도 저하를 최소화한다.
  • FPGA 자원 가용성에 따라 동적으로 SPoT와 고정소수점 양자화를 조합하는 혼합 기법(MS) 양자화를 도입하여 LUT와 DSP를 동시에 최적화한다.
  • 각 레이어의 5% 가중치에 대해 8비트 정밀도를 할당하는 레이어 내 다중 정밀도(MP) 전략을 개발하여, 레이어 간 다른 비트 폭이 필요 없이 모델 정확도를 유지한다.
  • FPGA 자원 활용도 분 析를 통해 최적화된 혼합 비율(예: 65% SPoT, 30% 고정소수점, 5% 8비트)을 활용하여 정확도와 성능의 균형을 확보한다.
  • 동일한 레이어 내에서 SPoT, 고정소수점, 8비트 양자화를 통합하는 통합 프레임워크를 구현하여 정확도 손실 없이 효율적인 하드웨어 매핑을 가능하게 한다.
  • Xilinx XC7Z020 및 XC7Z045 FPGA에서 100MHz 클럭 조건으로 ResNet-18 및 MobileNet-v2를 대상으로 프레임워크를 검증하며, 처리량, 지연 시간, 자원 활용도를 측정한다.

실험 결과

연구 질문

  • RQ1SPoT와 고정소수점 양자화를 결합한 혼합 기법 양자화 방식이 단일 기법 대비 FPGA 자원 활용도를 향상시킬 수 있는가?
  • RQ2레이어 내 다중 정밀도 양자화가 레이어 간 다중 정밀도 양자화보다 하드웨어 효율성과 정확도 유지 측면에서 뛰어난가?
  • RQ3SPoT 양자화 기법이 LUT에서 비트 시프트 연산을 통해 계산 효율성을 유지하면서 정확도 저하를 줄일 수 있는가?
  • RQ4제안된 MSP 프레임워크가 XC7Z020 및 XC7Z045와 같은 실제 FPGA 플랫폼에서 얼마나 빠른 성능 향상과 정확도 유지 성능을 달성할 수 있는가?
  • RQ5혼합 기법과 레이어 내 다중 정밀도 양자화의 조합이 FPGA에서 DNN 추론의 처리량과 자원 활용도에 어떤 영향을 미치는가?

주요 결과

  • MSP는 ResNet-18을 사용해 ImageNet에서 70.47%의 Top1 정확도를 달성했으며, 기준 플로ating 포인트 모델보다 0.71% 높은 정확도를 기록했다.
  • 고정소수점 양자화 대비 FPGA에서의 종단 간 추론 시간이 3.53배 빨라졌으며, XC7Z045에서 ResNet-18의 처리량은 120.5 GOPS에서 325.0 GOPS로 증가했다.
  • 모든 설정에서 DSP 활용도는 100% 유지되었고, SPoT 비율을 높일수록 LUT 활용도는 19%에서 69%로 증가하여 자원 균형 조절이 효과적으로 이루어졌음을 보여준다.
  • 레이어 내 다중 정밀도 전략 덕분에 첫 번째 및 마지막 레이어를 양자화하더라도 정확도 손실 없이 성능을 유지할 수 있었으며, 이는 이전 방법들이 이러한 레이어를 양자화를 피하는 경향이 있었던 것과 대비된다.
  • 제거 분석 결과, 혼합 기법 양자화(MS)는 단일 기법 대비 성능 향상과 정확도 향상을 보였고, 레이어 내 MP 전략은 정확도 손실 없이 성능을 추가로 향상시켰다.
  • 최적의 양자화 비율(65% SPoT, 30% 고정소수점, 5% 8비트)은 FPGA 자원 활용도 및 성능 프로파일링을 통해 검증되었으며, 효율성과 정확도 사이의 최적 균형을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.