[논문 리뷰] fpgaConvNet: A Toolflow for Mapping Diverse Convolutional Neural Networks on Embedded FPGAs
fpgaConvNet는 다양한 컨볼루션 네트워크(불규칙한 연결성 포함)를 임베디드 FPGA에 매핑하기 위해 설계된 자동화된 SDF 기반 툴플로우이다. 이는 설계 공간 탐색을 다목적 최적화 문제로 공식화함으로써, 동일한 5W 전력 예산 하에서 고도로 최적화된 임베디드 GPU 설계보다 최대 6.65배 높은 처리량을 달성한다.
In recent years, Convolutional Neural Networks (ConvNets) have become an enabling technology for a wide range of novel embedded Artificial Intelligence systems. Across the range of applications, the performance needs vary significantly, from high-throughput video surveillance to the very low-latency requirements of autonomous cars. In this context, FPGAs can provide a potential platform that can be optimally configured based on the different performance needs. However, the complexity of ConvNet models keeps increasing making their mapping to an FPGA device a challenging task. This work presents fpgaConvNet, an end-to-end framework for mapping ConvNets on FPGAs. The proposed framework employs an automated design methodology based on the Synchronous Dataflow (SDF) paradigm and defines a set of SDF transformations in order to efficiently explore the architectural design space. By selectively optimising for throughput, latency or multiobjective criteria, the presented tool is able to efficiently explore the design space and generate hardware designs from high-level ConvNet specifications, explicitly optimised for the performance metric of interest. Overall, our framework yields designs that improve the performance by up to 6.65x over highly optimised embedded GPU designs for the same power constraints in embedded environments.
연구 동기 및 목표
- 엄격한 전력, 처리량, 지연 시간 제약 조건 하에서 복잡하고 다양한 컨볼루션 네트워크를 임베디드 FPGA에 매핑하는 데 발생하는 증가하는 도전 과제를 해결하기 위해.
- 수동 작업을 줄이고 효율성을 높이기 위해 커다란 다차원 FPGA 설계 공간에 대한 자동 탐색을 자동화하기 위해.
- 기존의 AlexNet과 VGG16와 같은 전통적 모델을 넘어서 ResNet, DenseNet, Inception 등의 정규 및 비정규 컨볼루션 네트워크 아키텍처를 지원하기 위해.
- 응용 분야에 맞는 성능 요구 사항을 바탕으로 처리량, 지연 시간, 또는 다목적 기준에 최적화된 하드웨어 가속기를 생성하기 위해.
- 모바일 및 임베디드 시스템에서 낮은 전력 소비를 유지하면서도 고도로 최적화된 임베디드 GPU 솔루션을 초월하는 성능-와트 비율을 확보하기 위해.
제안 방법
- 프레임워크는 컨볼루션 네트워크 워크로드와 FPGA 하드웨어 매핑을 데이터 플로우 간선과 연산 노드를 갖는 방향 그래프로 표현하기 위해 동기 데이터플로우(Synchronous Dataflow, SDF) 모델을 사용한다.
- 설계 공간 탐색을 수학적 최적화 문제로 공식화하며, 컴파일 타임 설정 가능한 빌딩 블록과 그 자원-성능 트레이드오프를 매개변수로 설정한다.
- 성능-자원 트레이드오프를 탐색하기 위해 그래프 분할(재구성 가능), 거시 및 미세 단위의 폴딩, 가중치 재로드 등의 SDF 변환 집합을 대수적으로 적용한다.
- 프레임워크는 Caffe를 프론트엔드로 지원하며, Xilinx Zynq 7045 FPGA에서 16비트 고정소수점 산술(FXP16)을 사용해 모델을 매핑한다.
- 효율적이고 자동화된 설계 공간 탐색을 가능하게 하기 위해 분석 기반의 처리량, 지연 시간, 자원 소비 모델을 통합한다.
- 이 방법은 고수준의 컨볼루션 네트워크 사양에서 스트리밍 가속기까지의 엔드 투 엔드 생성을 가능하게 하며, DenseNet 및 ResNet의 불규칙한 데이터플로우도 지원한다.
실험 결과
연구 질문
- RQ1자동화된 툴플로우는 전력, 처리량, 지연 시간 제약 조건을 고려하면서도 광범위한 FPGA 설계 공간을 효율적으로 탐색할 수 있는가?
- RQ2동일한 전력 예산 하에서 임베디드 GPU 구현에 비해 FPGA 기반 컨볼루션 네트워크 가속기의 성능은 어떻게 비교되는가?
- RQ3제안된 SDF 기반 방법론은 정규 및 비정규 컨볼루션 네트워크 아키텍처(예: DenseNet-161 포함)를 효과적으로 처리할 수 있는가?
- RQ4임베디드 FPGA 구현에서 처리량과 지연 시간을 동시에 고려한 다목적 기준 최적화는 어느 정도의 수준까지 가능한가?
- RQ5FPGA 최적화된 컨볼루션 네트워크 가속기는 최신 기술 수준의 임베디드 GPU 대비 어떤 성능-와트 비율 향상을 달성할 수 있는가?
주요 결과
- fpgaConvNet는 5W 전력 예산 하에서 지연 민감한 응용 분야에서 NVIDIA Tegra X1 GPU 대비 최대 6.65배 높은 처리량을 달성한다.
- 처리량 중심의 워크로드에서 fpgaConvNet는 Tegra X1 대비 평균 3.32배의 처리량 향상을 보이며 기하 평균 3.07배의 향상을 기록한다.
- 지연 민감한 시나리오에서는 fpgaConvNet가 Tegra X1 대비 평균 3.95배의 처리량 향상을 기록했으며 기하 평균 3.43배의 향상을 달성한다.
- 피크 GPU 주파수(998 MHz)에서 평가한 결과, fpgaConvNet는 지연 중심 응용 분야에서 Tegra X1 대비 1.70배 높은 성능-와트 비율을 확보했다.
- 이 프레임워크는 DenseNet-161에 대한 첫 번째 알려진 FPGA 매핑을 가능하게 하여 복잡하고 비정규적인 컨볼루션 네트워크 아키텍처를 처리할 수 있는 능력을 입증했다.
- 고도로 최적화된 임베디드 GPU 설계 대비 fpgaConvNet는 성능-와트 비율을 최대 1.70배 향상시켰으며, 피크 GPU 성능 조건에서도 동일한 성과를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.