[논문 리뷰] DNNExplorer: A Framework for Modeling and Exploring a Novel Paradigm of FPGA-based DNN Accelerator
DNNExplorer는 고성능, 고특이성, 고확장성을 달성하기 위해 전용 파이프라인 스테이지와 재사용 가능한 계산 유닛을 조합하는 새로운 FPGA 기반 DNN 가속기 설계 패러다임을 도입하는 프레임워크이다. 동적 설계 공간과 이중 수준의 설계 공간 탐색(DSE) 엔진을 활용하여 최적화된 가속기를 생성함으로써, 최신 기술인 DNNBuilder 솔루션 대비 최대 4.2배 높은 처리량(GOP/s)과 상업용 Xilinx DPU 대비 최대 4.4배 높은 DSP 효율성을 달성한다.
Existing FPGA-based DNN accelerators typically fall into two design paradigms. Either they adopt a generic reusable architecture to support different DNN networks but leave some performance and efficiency on the table because of the sacrifice of design specificity. Or they apply a layer-wise tailor-made architecture to optimize layer-specific demands for computation and resources but loose the scalability of adaptation to a wide range of DNN networks. To overcome these drawbacks, this paper proposes a novel FPGA-based DNN accelerator design paradigm and its automation tool, called DNNExplorer, to enable fast exploration of various accelerator designs under the proposed paradigm and deliver optimized accelerator architectures for existing and emerging DNN networks. Three key techniques are essential for DNNExplorer's improved performance, better specificity, and scalability, including (1) a unique accelerator design paradigm with both high-dimensional design space support and fine-grained adjustability, (2) a dynamic design space to accommodate different combinations of DNN workloads and targeted FPGAs, and (3) a design space exploration (DSE) engine to generate optimized accelerator architectures following the proposed paradigm by simultaneously considering both FPGAs' computation and memory resources and DNN networks' layer-wise characteristics and overall complexity. Experimental results show that, for the same FPGAs, accelerators generated by DNNExplorer can deliver up to 4.2x higher performances (GOP/s) than the state-of-the-art layer-wise pipelined solutions generated by DNNBuilder for VGG-like DNN with 38 CONV layers. Compared to accelerators with generic reusable computation units, DNNExplorer achieves up to 2.0x and 4.4x DSP efficiency improvement than a recently published accelerator design from academia (HybridDNN) and a commercial DNN accelerator IP (Xilinx DPU), respectively.
연구 동기 및 목표
- 기존 FPGA 기반 DNN 가속기의 한계를 해결하기 위해, 재사용성을 위해 성능을 희생하거나 특정성을 위해 확장성을 희생하는 경우를 방지하기 위해.
- 다양한 DNN 모델에 걸쳐 세밀한 맞춤화와 확장성의 균형을 이룰 수 있는 새로운 가속기 설계 패러다임을 제안하기 위해.
- 새로운 패러다임 하에서 고차원 설계 공간을 신속하고 효율적으로 탐색할 수 있는 자동화된 프레임워크인 DNNExplorer를 개발하기 위해.
- FPGA 자원 제약(DSP, BRAM)과 DNN 레이어 특성(계산 대 통신 비율, 복잡도)을 동시에 최적화하기 위해.
- 기존 및 신규 심층 신경망 워크로드를 위한 최적화된, 응용 분야에 특화된 가속기 아키텍처를 제공하기 위해.
제안 방법
- 고계산량 레이어에 적합한 전용 파이프라인 스테이지와 저계산량 레이어에 적합한 재사용 가능한 유닛을 조합한 하이브리드 가속기 설계 패러다임을 도입하여 성능과 확장성 모두를 확보하기 위해.
- 다양한 DNN 모델과 FPGA 플랫폼에서 가속기 파rameter의 세부 설정(작업 분할, 자원 할당, 배치 크기 포함)을 포괄하는 동적 설계 공간을 정의하기 위해.
- 글로벌 검색을 통한 고수준 아키텍처 결정과 로컬 검색을 통한 세부 조정을 수행하는 이중 수준 DSE 엔진을 활용하며, 효율성을 향리하기 위해 조기 종료 기법을 적용하기 위해.
- 레이어 단위의 DNN 특성과 FPGA 제약 조건을 바탕으로 처리량과 자원 활용도를 예측하기 위해 성능 모델링을 활용하기 위해.
- 하드웨어 자원 제약과 DNN 워크로드 요구사항을 모두 고려한 반복적 탐색을 통해 최적화된 가속기 구성 자동 생성하기 위해.
- 고차원 설계 공간을 효율적으로 관리하기 위해 DSE 과정에서 분할 정복 전략을 적용하여 표준 CPU에서 분당 이내의 탐색 시간을 달성하기 위해.
실험 결과
연구 질문
- RQ1전용 파이프라인과 재사용 가능한 유닛을 조합한 하이브리드 FPGA 가속기 설계가 기존의 일반화된 또는 레이어 단위 파이프라인 패러다임에 비해 처리량과 효율성 측면에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2다양한 DNN 모델과 FPGA 플랫폼에서 가속기 파rameter의 세밀한 설정을 지원하기 위해 동적 설계 공간을 어떻게 정의할 수 있는가?
- RQ3이중 수준 DSE 엔진이 FPGA 자원 제약 조건을 충족하면서도 고차원 설계 공간을 얼마나 효율적으로 탐색할 수 있는가?
- RQ4더 깊은 DNN(즉, 더 많은 합성곱 레이어를 포함한 네트워크)를 대상으로 할 경우, 제안된 프레임워크는 어떻게 확장 가능한가?
- RQ5DNNBuilder, HybridDNN, Xilinx DPU와 같은 최신 기술 DNN 가속기 대비 어떤 성능 및 효율성 향상을 달성할 수 있는가?
주요 결과
- 38층의 VGG 유사 DNN에 대해 DNNExplorer가 생성한 가속기는 동일한 Xilinx KU115 FPGA에서 최신 기술인 DNNBuilder 솔루션 대비 최대 4.2배 높은 처리량(GOP/s)을 달성한다.
- 일반화된 HybridDNN 가속기 대비 DNNExplorer는 더 작은 입력 크기에서는 최대 2.0배, 더 큰 입력 크기에서는 최대 1.3배 높은 DSP 효율성을 확보한다.
- 상용 Xilinx DPU IP 대비 DNNExplorer는 ZCU102 FPGA에서 평균 1.6배 높은 DSP 효율성을 확보했으며, 가장 작은 입력 크기에서는 최대 4.4배까지 향상되었다.
- DNNExplorer의 DSE 엔진은 12종의 서로 다른 입력 크기와 다양한 배치 크기를 고려한 고차원 설계 공간에서도 평균 탐색 시간이 분 단위 이내로 최적화된 구성 설정을 제공한다.
- 깊은 네트워크에 대해서도 프레임워크는 뛰어난 성능 유지를 보이며, 38층 모델에서 DNNExplorer는 DNNBuilder 대비 처리량 측면에서 4.2배 높은 성능을 기록하여 강력한 확장성 잠재력을 입증한다.
- 다양한 입력 크기에서 처리량이 일관되게 높게 유지되며, 입력 크기가 증가함에 따라 성능 저하가 최소화되어 강건성과 적응 가능성에 뛰어난 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.