Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking Quantized Neural Networks on FPGAs with FINN

Q. Ducasse, Pascal Cotret|arXiv (Cornell University)|2021. 02. 02.
Advanced Neural Network Applications참고 문헌 22인용 수 13
한 줄 요약

이 논문은 FINN 프레임워크를 사용하여 FPGAs에서 혼합 정밀도 양자화 신경망을 벤치마킹하며, 2–8비트 양자화가 최소 정확도 손실로 최대 62배 높은 처리량을 가능하게 함을 보여준다. 연구는 병렬화 구성 요소를 평가하며, 압축된 네트워크가 효율적으로 FPGA에 매핑될 수 있음을 보이며, 최적화된 양자화와 하드웨어 인식 훈련을 통해 낮은 자원 소비로 높은 성능을 달성한다.

ABSTRACT

The ever-growing cost of both training and inference for state-of-the-art neural networks has brought literature to look upon ways to cut off resources used with a minimal impact on accuracy. Using lower precision comes at the cost of negligible loss in accuracy. While training neural networks may require a powerful setup, deploying a network must be possible on low-power and low-resource hardware architectures. Reconfigurable architectures have proven to be more powerful and flexible than GPUs when looking at a specific application. This article aims to assess the impact of mixed-precision when applied to neural networks deployed on FPGAs. While several frameworks exist that create tools to deploy neural networks using reduced-precision, few of them assess the importance of quantization and the framework quality. FINN and Brevitas, two frameworks from Xilinx labs, are used to assess the impact of quantization on neural networks using 2 to 8 bit precisions and weights with several parallelization configurations. Equivalent accuracy can be obtained using lower-precision representation and enough training. However, the compressed network can be better parallelized allowing the deployed network throughput to be 62 times faster. The benchmark set up in this work is available in a public repository (https://github.com/QDucasse/nn benchmark).

연구 동기 및 목표

  • FPGA에 구현된 신경망 추론 성능에 대해 혼합 정밀도 양자화의 영향을 평가하기 위해.
  • 재구성 가능한 하드웨어에서 저정밀도 배포를 가능하게 하는 FINN 및 Brevitas 프레임워크의 효과성을 평가하기 위해.
  • 다양한 양자화 비트 폭(2–8비트)과 병렬화 전략이 처리량과 정확도에 미치는 영향을 분석하기 위해.
  • FPGA에서 양자화된 네트워크의 재현 가능한 평가를 위한 공개 벤치마킹 세트를 제공하기 위해.

제안 방법

  • 저자는 Xilinx의 FINN 및 Brevitas 프레임워크를 사용하여 신경망을 2–8비트 고정소수점 표현으로 양자화한다.
  • 모델 정확도를 낮은 정밀도 수준에서 유지하기 위해 훈련 후 양자화와 정밀 조정을 적용한다.
  • 하드웨어 인식 컴파일을 사용하여 양자화된 네트워크를 FPGA에 매핑하고 병렬 실행을 최적화한다.
  • 다양한 비트 폭과 병렬화 구성에서 처리량을 측정하여 성능 향상을 평가한다.
  • 재현 가능성을 보장하고 향후 비교를 용이하게 하기 위해 공개 벤치마킹 리포지토리를 구축한다.

실험 결과

연구 질문

  • RQ1혼합 정밀도 양자화는 FPGA에서 신경망의 정확도와 처리량에 어떤 영향을 미치는가?
  • RQ2FPGA 플랫폼에서 2–8비트 양자화를 통해 달성할 수 있는 최대 성능 향상은 얼마인가?
  • RQ3다양한 병렬화 전략은 FPGA에서 양자화된 네트워크의 효율성에 어떤 영향을 미치는가?
  • RQ4정밀도를 정밀도에서 2–8비트로 감소시킬 경우 정확도를 얼마나 잘 유지할 수 있는가?

주요 결과

  • 2–8비트 정밀도를 가진 양자화된 네트워크는 정밀 조정 후 전체 정밀도 모델과 동일한 정확도를 달성했다.
  • 배포된 네트워크의 처리량은 전체 정밀도 추론 대비 최대 62배 향상되었다.
  • 낮은 정밀도 표현은 더 적극적인 병렬화를 가능하게 하여 처리량을 크게 증가시켰다.
  • 벤치마킹 설정은 공개되어 있어 FPGA에서 양자화된 모델의 재현 가능한 평가가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.