Skip to main content
QUICK REVIEW

[논문 리뷰] FPGA/DNN Co-Design: An Efficient Design Methodology for IoT Intelligence on the Edge

Cong Hao, Xiaofan Zhang|arXiv (Cornell University)|2019. 04. 09.
Advanced Neural Network Applications참고 문헌 19인용 수 13
한 줄 요약

이 논문은 자원이 제한된 FPGAs에서 엣지 AI를 최적화하기 위해 하향식 FPGA 가속기 설계와 상향식 DNN 모델 탐색을 결합한 동시 FPGA/DNN 공동 설계 방법론을 제안한다. 자동화된 엔진(Auto-DNN 및 Auto-HLS)을 사용하여 하드웨어 인지 DNN와 합성 가능한 C 코드를 생성하며, PYNQ-Z1에서 최신 FPGA 설계 대비 6.2% 높은 IoU, 2.48배 높은 FPS, 40% 낮은 전력 소비, 2.5배 향상된 에너지 효율성을 달성한다.

ABSTRACT

While embedded FPGAs are attractive platforms for DNN acceleration on edge-devices due to their low latency and high energy efficiency, the scarcity of resources of edge-scale FPGA devices also makes it challenging for DNN deployment. In this paper, we propose a simultaneous FPGA/DNN co-design methodology with both bottom-up and top-down approaches: a bottom-up hardware-oriented DNN model search for high accuracy, and a top-down FPGA accelerator design considering DNN-specific characteristics. We also build an automatic co-design flow, including an Auto-DNN engine to perform hardware-oriented DNN model search, as well as an Auto-HLS engine to generate synthesizable C code of the FPGA accelerator for explored DNNs. We demonstrate our co-design approach on an object detection task using PYNQ-Z1 FPGA. Results show that our proposed DNN model and accelerator outperform the state-of-the-art FPGA designs in all aspects including Intersection-over-Union (IoU) (6.2% higher), frames per second (FPS) (2.48X higher), power consumption (40% lower), and energy efficiency (2.5X higher). Compared to GPU-based solutions, our designs deliver similar accuracy but consume far less energy.

연구 동기 및 목표

  • 엄격한 지연 및 전력 제약 조건을 가진 자원이 제한된 엣지 FPGAs에 고정확도 DNN를 구현하는 데 도전하는 문제를 해결한다.
  • DNN 개발 중 하드웨어 제약 조건을 忽시하는 전통적인 상향식 설계 흐름의 한계를 극복한다.
  • 자동화된 공동 설계 흐름을 통해 DNN 아키텍처와 FPGA 가속기 설계를 동시에 최적화할 수 있도록 한다.
  • 임베디드 FPGA에서 엣지 AI 워크로드의 정확도, 속도, 전력 효율성, 에너지 효율성 면에서 뛰어난 성능을 달성한다.

제안 방법

  • 예측 가능한 자원 사용량을 확보하기 위해 DNN 아키텍처 탐색을 제약하고 이끌기 위한 하드웨어 인지 DNN 템플릿(Bundle-Arch)을 제안한다.
  • 하드웨어 제약 조건 하에서 DNN 공간을 탐색하여 고정확도, FPGA 우호적인 모델를 찾는 자동 DNN 모델 탐색 엔진인 Auto-DNN을 도입한다.
  • Auto-DNN가 생성한 임의의 DNN를 지원하는 타일 기반, 세밀한 파이프라인 아키텍처를 위한 FPGA 가속기 설계를 개발한다.
  • DNN 모델에서 FPGA 가속기의 합성 가능한 C 코드를 생성하여 지연 및 자원 추정이 가능한 자동 HLS 생성기인 Auto-HLS를 도입한다.
  • Auto-DNN와 Auto-HLS를 통합하여 DNN 및 가속기 설계를 공동으로 최적화하는 완전 자동 공동 설계 흐름을 구현한다.
  • 루프 융합 및 片상 버퍼 할당을 적용하여 생성된 C 코드의 성능을 추가로 최적화한다.

실험 결과

연구 질문

  • RQ1동시로 DNN 아키텍처와 FPGA 가속기 설계를 최적화하는 공동 설계 방법론이 자원이 제한된 엣지 FPGAs에서 기존 상향식 접근 방식을 능가할 수 있는가?
  • RQ2자원이 제한된 FPGAs에서 표준 DNN 대비 하드웨어 인지 DNN 탐색이 정확도와 효율성 향상에 얼마나 기여하는가?
  • RQ3제안된 자동 공동 설계 흐름은 정확도, 지연, 에너지 효율성 면에서 높은 성능을 달성하면서도 엔지니어링 노력은 얼마나 줄일 수 있는가?
  • RQ4공동 설계된 DNN와 가속기가 훨씬 낮은 전력 소비로 GPU 기반 솔루션과 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5실제 임베디드 FPGA 플랫폼에서 제안된 방법론을 사용할 경우 정확도, 프레임 당 초수(FPS), 전력 소비 간의 상호 교환 관계는 어떻게 이루어지는가?

주요 결과

  • 제안된 공동 설계 방법론은 DAC-SDC 경쟁 대회에서 1위를 차지한 FPGA 솔루션 대비 6.2% 높은 교차율(Intersection-over-Union, IoU)을 달성했다.
  • 최신 FPGA 설계 대비 2.48배 높은 초당 프레임 수(FPS)를 확보하였으며, PYNQ-Z1에서 150 MHz에서 29.7 FPS를 기록했다.
  • 기존 최고 수준의 FPGA 설계 대비 전력 소비를 40% 감소시켰으며, 전체 추론 파이프라인에 대해 단지 2.4W의 전력 소비를 기록했다.
  • 최신 FPGA 설계 대비 에너지 효율성을 2.5배 향상시켰으며, GPU 기반 솔루션 대비 3.1배에서 3.8배 더 뛰어난 성능을 보였다.
  • DNN 모델은 17.4 FPS(150 MHz)에서 68.6%의 IoU를 달성하여 정확도 및 에너지 효율성 면에서 1위 FPGA 솔루션을 모두 능가했다.
  • GPU 기반 설계 대비 정확도는 동등하거나 약간 떨어졌지만(3위 대비 0.1% 우수, 1위 대비 1.2% 열등), 시계수주가 6배 낮은 상황에서도 에너지 효율성은 3.6배 뛰어나게 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.