[논문 리뷰] HybridDNN: A Framework for High-Performance Hybrid DNN Accelerator Design and Implementation
HybridDNN는 하이브리드 공간/윈오그라드 컨볼루션 처리 엔진과 다중 데이터플로우 지원, 자동 설계 공간 탐색을 통합함으로써 FPGA 상에서 고성능, 유연성 있고 확장 가능한 DNN 가속기 설계를 가능하게 하는 프레임워크이다. VU9P에서 3375.7 GOPS, PYNQ-Z1에서 83.3 GOPS를 달성하여 최신 기술 대비 1.8배 높은 성능과 2.0배 높은 에너지 효율성을 제공한다.
To speedup Deep Neural Networks (DNN) accelerator design and enable effective implementation, we propose HybridDNN, a framework for building high-performance hybrid DNN accelerators and delivering FPGA-based hardware implementations. Novel techniques include a highly flexible and scalable architecture with a hybrid Spatial/Winograd convolution (CONV) Processing Engine (PE), a comprehensive design space exploration tool, and a complete design flow to fully support accelerator design and implementation. Experimental results show that the accelerators generated by HybridDNN can deliver 3375.7 and 83.3 GOPS on a high-end FPGA (VU9P) and an embedded FPGA (PYNQ-Z1), respectively, which achieve a 1.8x higher performance improvement compared to the state-of-art accelerator designs. This demonstrates that HybridDNN is flexible and scalable and can target both cloud and embedded hardware platforms with vastly different resource constraints.
연구 동기 및 목표
- 다양한 자원 제약을 가진 FPGA 플랫폼에 맞는 고성능, 에너지 효율적인 DNN 가속기 설계의 과제를 해결하기 위해.
- 기존 FPGA 기반 DNN 가속기의 확장성 부족, 메모리 대역폭 제약, 복잡한 설계 프로세스 등의 한계를 극복하기 위해.
- 클라우드(고자원) 및 임베디드(저자원) FPGA 플랫폼을 모두 지원하는 민첩하고 자동화된 프레임워크를 제공하기 위해.
- 성능 예측, 설계 공간 탐색, 고수준 합성(HLS)을 통합함으로써 빠른 프로토타이핑을 위한 효율적인 하드웨are-소프트웨어 공동 설계를 가능하게 하기 위해.
- CONV 모드(Spatial/Winograd), 데이터플로우(IS/WS), 병렬성 요소를 자동으로 선택하여 최적의 가속기 구성 선택을 가능하게 하기 위해.
제안 방법
- 프레임워크는 동일한 하드웨어를 재사용하여 두 가지 계산 모드를 모두 지원하는 하이브리드 공간/윈오그라드 컨볼루션 처리 요소(PE)를 활용하여 면적 오 overhead 를 최소화한다.
- 메모리 액세스 패턴과 데이터 재사용을 최적화하기 위해 입력 정적(IS) 및 가중치 정적(WS) 두 가지 데이터플로우 아키텍처를 지원한다.
- 통합 분석 성능 모델은 VU9P와 PYNQ-Z1에서 각각 4.27% 및 4.03% 이내의 오차로 처리량과 에너지 효율을 추정한다.
- 설계 공간 탐색(DSE) 엔진은 성능 및 자원 제약 조건을 기반으로 CONV 모드, 데이터플로우, 병렬성 요소에 대한 최적의 구성 설정을 자동으로 선택한다.
- 직접 FPGA에 구현 가능한 C/C++ 기반 고수준 합성(HLS) 코드를 생성함으로써 빠른 커스터마이제이션과 이식성을 보장한다.
- 공간 모드와 윈오그라드 모드 간에 LUT와 DSP를 재사용함으로써 자원 활용도를 최적화하였으며, VU9P에서 하이브리드 지원을 위해 추가로 26.4%의 LUT만 필요로 한다.
실험 결과
연구 질문
- RQ1통합된 DNN 가속기 프레임워크는 고성능 클라우드 FPGA와 자원 제약이 있는 임베디드 FPGA를 모두 효율적으로 지원할 수 있는가?
- RQ2최소한의 면적 오버헤드로 고성능을 유지하면서 하이브리드 공간/윈오그라드 컨볼루션을 어떻게 구현할 수 있는가?
- RQ3분석 성능 모델이 DNN 가속기 설계에서 정확하고 빠른 설계 공간 탐색을 얼마나 잘 이끌 수 있는가?
- RQ4기존의 단일 모드 가속기 대비 하이브리드 CONV 모드를 사용할 경우 성능 및 에너지 효율성 향상은 어느 정도인가?
- RQ5실제 DNN 워크로드에서 메모리 대역폭이 공간 모드와 윈오그라드 모드 간 성능 트레이드오���에 어떤 영향을 미치는가?
주요 결과
- HybridDNN가 생성한 가속기는 고성능 VU9P FPGA에서 3375.7 GOPS를 달성하여 최신 기술 대비 1.8배 높은 성능 향상을 보였다.
- 임베디드 PYNQ-Z1 FPGA에서 프레임워크는 83.3 GOPS를 제공하였으며, 이는 이전 FPGA 기반 설계 대비 2.0배 높은 에너지 효율성(73.5 GOPS/W)을 달성하였다.
- 하이브리드 CONV PE는 VU9P에서 추가로 26.4%의 LUT만 사용하고, 추가 DSP가 없어 공간 모드와 윈오그라드 모드 간의 효율적인 하드웨어 공유를 입증하였다.
- 분석 성능 모델은 VU9P와 PYNQ-Z1에서 각각 4.27% 및 4.03%의 추정 오차를 기록하여 신뢰할 수 있고 빠른 설계 공간 탐색을 가능하게 하였다.
- 메모리 대역폭이 충분할 경우 윈오그라드 모드가 공간 모드를 초월하지만, 메모리 제약 조건에서는 성능이 저하되어 적응형 구성의 중요성을 입증하였다.
- DSE 엔진은 VU9P에서 VGG16의 모든 CONV 레이어에 대해 윈오그라드 모드를 성공적으로 선택하여 워크로드 특화 자원 제약 조건에 최적화된 능력을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.