Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Binarized Neural Networks on Reconfigurable Logic

Nicholas J. Fraser, Yaman Umuroglu|arXiv (Cornell University)|2017. 01. 12.
Advanced Neural Network Applications참고 문헌 21인용 수 6
한 줄 요약

이 논문은 대규모 FPGA에서 이진화 신경망(BNNs)을 스케일링하기 위해 FINN 프레임워크를 개선하여 -1 기반 패딩 기법을 도입함으로써 1비트 데이터경로를 유지하면서 정확도를 향상시켰다. 이는 ADM-PCIE-8K5 FPGA 플랫폼에서 CIFAR-10에서 88.7% 정확도로 12,000 FPS 추론 성능과 14.8 TOPS 성능, 41W 이하 전력 소비를 달성하여 높은 효율성과 확장성을 입증한다.

ABSTRACT

Binarized neural networks (BNNs) are gaining interest in the deep learning community due to their significantly lower computational and memory cost. They are particularly well suited to reconfigurable logic devices, which contain an abundance of fine-grained compute resources and can result in smaller, lower power implementations, or conversely in higher classification rates. Towards this end, the Finn framework was recently proposed for building fast and flexible field programmable gate array (FPGA) accelerators for BNNs. Finn utilized a novel set of optimizations that enable efficient mapping of BNNs to hardware and implemented fully connected, non-padded convolutional and pooling layers, with per-layer compute resources being tailored to user-provided throughput requirements. However, FINN was not evaluated on larger topologies due to the size of the chosen FPGA, and exhibited decreased accuracy due to lack of padding. In this paper, we improve upon Finn to show how padding can be employed on BNNs while still maintaining a 1-bit datapath and high accuracy. Based on this technique, we demonstrate numerous experiments to illustrate flexibility and scalability of the approach. In particular, we show that a large BNN requiring 1.2 billion operations per frame running on an ADM-PCIE-8K5 platform can classify images at 12 kFPS with 671 us latency while drawing less than 41 W board power and classifying CIFAR-10 images at 88.7% accuracy. Our implementation of this network achieves 14.8 trillion operations per second. We believe this is the fastest classification rate reported to date on this benchmark at this level of accuracy.

연구 동기 및 목표

  • 임베디드 플랫폼을 초월하여 대규모 FPGA에서 이진화 신경망(BNNs)의 확장성 문제를 해결한다.
  • 이전의 FINN 기반 BNN FPGA 가속기에서 패딩 부족으로 인한 정확도 저하 문제를 해결한다.
  • 더 큰 네트워크 아키텍처를 지원하기 위해 BNN 가속기의 BRAM 활용 효율성을 향상시킨다.
  • 재구성 가능한 논리 회로에서 1비트 데이터경로를 유지하면서 고처리량, 저전력 BNN 추론을 가능하게 한다.
  • 현대 FPGA 플랫폼에서 FINN 프레임워크를 활용해 대규모 BNN에 대해 최신 성능 기준을 달성한다.

제안 방법

  • BNN에서 1비트 데이터경로를 유지하기 위해 0 대신 -1 값을 사용하는 수정된 패딩 전략을 제안한다.
  • 병렬 다수의 벡터 곱셈을 지원하기 위해 MVTU(Matrix-Vector Tensor Unit)에 아키텍처적 개선을 도입하여 BRAM 활용도를 향상시킨다.
  • ADM-PCIE-8K5 FPGA에서 메모리 파artitioning과 자원 할당 최적화를 통해 FINN 프레임워크를 확장하여 더 큰 BNN을 지원한다.
  • 처리량 요구사항에 맞춘 레이어별 계산 자원을 갖춘 스트리밍 아키텍처를 구현한다.
  • 다중 승수기능을 제거하고 XNOR 및 popcount 연산을 사용하여 이진 추론을 구현함으로써 면적과 전력 소비를 감소시킨다.
  • 외부 메모리 액세스를 최소화하고 대역폭을 향상시키기 위해 가중치와 활성화 버퍼에 온칩 메모리(OCM)를 적용한다.

실험 결과

연구 질문

  • RQ1현대 FPGA에서 1비트 데이터경로를 유지하면서 대규모 고처리량 추론 작업으로 BNN을 확장할 수 있는가?
  • RQ22비트 데이터경로가 필요 없이 정확도를 희생시키지 않고 패딩을 효과적으로 적용할 수 있는가?
  • RQ3고성능 FPGA에서 더 큰 네트워크로 확장할 때 FINN 프레임워크의 주요 병목 현상은 무엇인가?
  • RQ4BNN 가속기에서 BRAM 활용도를 얼마나 향상시킬 수 있는가? 더 큰 모델을 지원하기 위해선 어떻게 해야 하는가?
  • RQ5CIFAR-10에서 88% 이상의 정확도와 41W 이하의 저전력 소비로 12K FPS 이상의 고속 추론 성능을 달성할 수 있는가?

주요 결과

  • 제안된 -1 기반 패딩은 1비트 데이터경로를 유지하면서 CIFAR-10에서 BNN 정확도를 88.7%로 향상시켰으며, 패딩 없음 및 0 패딩과 동일한 정확도를 달성했다.
  • ADM-PCIE-8K5 FPGA에서 671μs의 지연 시간으로 12,000 프레임 매초(FPS)의 성능을 달성했다.
  • 보드 전력 소비가 41W 이하인 상태에서 14.8조 연산 매초(TOPS)의 성능을 제공했다.
  • FINN에서의 BRAM 활용도는 최적화되지 않아, 고정된 $F^m$에 의해 발생하는 가중치 메모리 할당의 분할로 인해 평균 약 22%의 효율성에 머물렀다.
  • 병렬 다수의 벡터 곱셈을 지원하도록 MVTU에 아키텍처적 개선을 도입하면 BRAM 활용도가 크게 향상되고 자원 오버헤드도 감소할 수 있다.
  • 이 방법은 CIFAR-10에서 88.7% 정확도로 BNN의 분류 속도 기준으로 가장 높은 보고된 성능을 달성하여 FPGA에서 이진화 추론의 새로운 성능 기준을 설정했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.