Skip to main content
QUICK REVIEW

[논문 리뷰] HybridDNN: A Framework for High-Performance Hybrid DNN Accelerator Design and Implementation

Hanchen Ye, Xiaofan Zhang|arXiv (Cornell University)|2020. 04. 08.
Advanced Neural Network Applications참고 문헌 22인용 수 5
한 줄 요약

HybridDNN는 하이브리드 공간/윈오그라드 컨볼루션 처리 엔진과 다중 데이터플로우 지원, 자동 설계 공간 탐색을 통합함으로써 FPGA 상에서 고성능, 유연성 있고 확장 가능한 DNN 가속기 설계를 가능하게 하는 프레임워크이다. VU9P에서 3375.7 GOPS, PYNQ-Z1에서 83.3 GOPS를 달성하여 최신 기술 대비 1.8배 높은 성능과 2.0배 높은 에너지 효율성을 제공한다.

ABSTRACT

To speedup Deep Neural Networks (DNN) accelerator design and enable effective implementation, we propose HybridDNN, a framework for building high-performance hybrid DNN accelerators and delivering FPGA-based hardware implementations. Novel techniques include a highly flexible and scalable architecture with a hybrid Spatial/Winograd convolution (CONV) Processing Engine (PE), a comprehensive design space exploration tool, and a complete design flow to fully support accelerator design and implementation. Experimental results show that the accelerators generated by HybridDNN can deliver 3375.7 and 83.3 GOPS on a high-end FPGA (VU9P) and an embedded FPGA (PYNQ-Z1), respectively, which achieve a 1.8x higher performance improvement compared to the state-of-art accelerator designs. This demonstrates that HybridDNN is flexible and scalable and can target both cloud and embedded hardware platforms with vastly different resource constraints.

연구 동기 및 목표

  • 다양한 자원 제약을 가진 FPGA 플랫폼에 맞는 고성능, 에너지 효율적인 DNN 가속기 설계의 과제를 해결하기 위해.
  • 기존 FPGA 기반 DNN 가속기의 확장성 부족, 메모리 대역폭 제약, 복잡한 설계 프로세스 등의 한계를 극복하기 위해.
  • 클라우드(고자원) 및 임베디드(저자원) FPGA 플랫폼을 모두 지원하는 민첩하고 자동화된 프레임워크를 제공하기 위해.
  • 성능 예측, 설계 공간 탐색, 고수준 합성(HLS)을 통합함으로써 빠른 프로토타이핑을 위한 효율적인 하드웨are-소프트웨어 공동 설계를 가능하게 하기 위해.
  • CONV 모드(Spatial/Winograd), 데이터플로우(IS/WS), 병렬성 요소를 자동으로 선택하여 최적의 가속기 구성 선택을 가능하게 하기 위해.

제안 방법

  • 프레임워크는 동일한 하드웨어를 재사용하여 두 가지 계산 모드를 모두 지원하는 하이브리드 공간/윈오그라드 컨볼루션 처리 요소(PE)를 활용하여 면적 오 overhead 를 최소화한다.
  • 메모리 액세스 패턴과 데이터 재사용을 최적화하기 위해 입력 정적(IS) 및 가중치 정적(WS) 두 가지 데이터플로우 아키텍처를 지원한다.
  • 통합 분석 성능 모델은 VU9P와 PYNQ-Z1에서 각각 4.27% 및 4.03% 이내의 오차로 처리량과 에너지 효율을 추정한다.
  • 설계 공간 탐색(DSE) 엔진은 성능 및 자원 제약 조건을 기반으로 CONV 모드, 데이터플로우, 병렬성 요소에 대한 최적의 구성 설정을 자동으로 선택한다.
  • 직접 FPGA에 구현 가능한 C/C++ 기반 고수준 합성(HLS) 코드를 생성함으로써 빠른 커스터마이제이션과 이식성을 보장한다.
  • 공간 모드와 윈오그라드 모드 간에 LUT와 DSP를 재사용함으로써 자원 활용도를 최적화하였으며, VU9P에서 하이브리드 지원을 위해 추가로 26.4%의 LUT만 필요로 한다.

실험 결과

연구 질문

  • RQ1통합된 DNN 가속기 프레임워크는 고성능 클라우드 FPGA와 자원 제약이 있는 임베디드 FPGA를 모두 효율적으로 지원할 수 있는가?
  • RQ2최소한의 면적 오버헤드로 고성능을 유지하면서 하이브리드 공간/윈오그라드 컨볼루션을 어떻게 구현할 수 있는가?
  • RQ3분석 성능 모델이 DNN 가속기 설계에서 정확하고 빠른 설계 공간 탐색을 얼마나 잘 이끌 수 있는가?
  • RQ4기존의 단일 모드 가속기 대비 하이브리드 CONV 모드를 사용할 경우 성능 및 에너지 효율성 향상은 어느 정도인가?
  • RQ5실제 DNN 워크로드에서 메모리 대역폭이 공간 모드와 윈오그라드 모드 간 성능 트레이드오���에 어떤 영향을 미치는가?

주요 결과

  • HybridDNN가 생성한 가속기는 고성능 VU9P FPGA에서 3375.7 GOPS를 달성하여 최신 기술 대비 1.8배 높은 성능 향상을 보였다.
  • 임베디드 PYNQ-Z1 FPGA에서 프레임워크는 83.3 GOPS를 제공하였으며, 이는 이전 FPGA 기반 설계 대비 2.0배 높은 에너지 효율성(73.5 GOPS/W)을 달성하였다.
  • 하이브리드 CONV PE는 VU9P에서 추가로 26.4%의 LUT만 사용하고, 추가 DSP가 없어 공간 모드와 윈오그라드 모드 간의 효율적인 하드웨어 공유를 입증하였다.
  • 분석 성능 모델은 VU9P와 PYNQ-Z1에서 각각 4.27% 및 4.03%의 추정 오차를 기록하여 신뢰할 수 있고 빠른 설계 공간 탐색을 가능하게 하였다.
  • 메모리 대역폭이 충분할 경우 윈오그라드 모드가 공간 모드를 초월하지만, 메모리 제약 조건에서는 성능이 저하되어 적응형 구성의 중요성을 입증하였다.
  • DSE 엔진은 VU9P에서 VGG16의 모든 CONV 레이어에 대해 윈오그라드 모드를 성공적으로 선택하여 워크로드 특화 자원 제약 조건에 최적화된 능력을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.