Skip to main content
QUICK REVIEW

[논문 리뷰] A Competitive Edge: Can FPGAs Beat GPUs at DCNN Inference Acceleration in Resource-Limited Edge Computing Applications?

Ian Colbert, Jake Daly|arXiv (Cornell University)|2021. 01. 30.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 8
한 줄 요약

이 논문은 자원이 제한된 엣지 디바이스에서 효율적인 디컨볼루션 신경망(DCNN) 추론을 위한 시간-공간 병렬화된 FPGA 가속기 기반의 새로운 접근법을 제안한다. 제로 패딩을 포함하지 않는 디컨볼루션 알고리즘을 마이크로아키텍처 혁신과 통계 분석으로 최적화함으로써, MNIST 및 CelebA 데이터셋에서 NVIDIA Jetson TX1 GPU보다 더 높은 처리량 대 전력 비용 비율과 더 낮은 런-투-런 변동성을 확보하였다.

ABSTRACT

When trained as generative models, Deep Learning algorithms have shown exceptional performance on tasks involving high dimensional data such as image denoising and super-resolution. In an increasingly connected world dominated by mobile and edge devices, there is surging demand for these algorithms to run locally on embedded platforms. FPGAs, by virtue of their reprogrammability and low-power characteristics, are ideal candidates for these edge computing applications. As such, we design a spatio-temporally parallelized hardware architecture capable of accelerating a deconvolution algorithm optimized for power-efficient inference on a resource-limited FPGA. We propose this FPGA-based accelerator to be used for Deconvolutional Neural Network (DCNN) inference in low-power edge computing applications. To this end, we develop methods that systematically exploit micro-architectural innovations, design space exploration, and statistical analysis. Using a Xilinx PYNQ-Z2 FPGA, we leverage our architecture to accelerate inference for two DCNNs trained on the MNIST and CelebA datasets using the Wasserstein GAN framework. On these networks, our FPGA design achieves a higher throughput to power ratio with lower run-to-run variation when compared to the NVIDIA Jetson TX1 edge computing GPU.

연구 동기 및 목표

  • 모바일 및 엣지 컴퓨팅 환경에서 깊이 생성 모델의 저전력, 현장 내 추론에 대한 증가하는 수요를 충족시키기 위해.
  • 정제된 모델에서 흔히 발생하는 비정규 구조적 희소성과 조건부 실행 패턴을 처리하는 데에 한계가 있는 GPU의 문제점을 해결하기 위해.
  • 자원 제약이 있는 FPGA에서 DCNN 추론에 특화된 전력 효율적이고 재구성 가능한 하드웨어 가속기를 설계하기 위해.
  • DCNN에 가중치 정제를 적용할 때 성능과 생성 품질 사이의 균형을 맞추기 위해.
  • FPGA가 최적화된 엣지 GPU보다 DCNN 추론 작업에서 처리량 대 전력 비용 효율성 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • Zhang 등 [26]의 제로 삽입이 없는 디컨볼루션 알고리즘을 변형하여 자원 사용을 줄이고 하드웨어 내 데이터 플로우를 향상시켰다.
  • 공간 타일링과 시간적 파ip라인을 동시에 활용하는 시간-공간 병렬 아키텍처를 구현하여 메모리 접근과 계산의 효율성을 높였다.
  • 런타임 종속성 계산을 제거하고 처리량을 향상시키기 위해 모듈로 산술 연산의 사전 처리를 적용하였다.
  • 칩 내 버퍼링과 메모리 계층 구조 최적화를 통합하여 외부 메모리 접근을 최소화하고 지연을 감소시켰다.
  • 비정규 가중치 정제 중 생성 품질과 실행 속도의 균형을 맞추기 위해 MMD 기반 최적화 지표(Eq. 6)를 사용하였다.
  • 다차원 통계 분석을 수행하여 희소성이 성능과 모델 충실도에 미치는 영향을 평가하였다.

실험 결과

연구 질문

  • RQ1엔드포인트 애플리케이션에서 DCNN 추론에 대해 FPGA 기반 가속기가 GPU보다 더 높은 처리량 대 전력 비용 효율성을 달성할 수 있는가?
  • RQ2비정규 가중치 정제는 FPGA 기반 DCNN 추론에서 생성 품질과 하드웨어 성능에 어떤 영향을 미치는가?
  • RQ3자원 사용을 줄이면서도 높은 처리량을 유지하는 데 있어 FPGA 기반 DCNN 가속기에서 가장 효과적인 아키텍처 최적화는 무엇인가?
  • RQ4GPU 워크로드에 비해 FPGA에서 조건부 실행(예: 제로 스킵)을 네이티브로 지원할 경우, 희소적이고 정제된 모델에서 성능 향상은 어느 정도 이루어지는가?
  • RQ5FPGA 기반 GAN 추론에서 추론 속도와 생성 품질을 균형 있게 유지할 수 있는 최적의 희소 수준이 존재하는가?

주요 결과

  • FPGA 기반 가속기는 MNIST 및 CelebA DCNN 모두에서 NVIDIA Jetson TX1 GPU보다 더 높은 처리량 대 전력 비용 비율을 확보하였다.
  • GPU 대비 성능의 런-투-런 변동성이 낮아, 다양한 워크로드 하에서 더 높은 일관성을 보였다.
  • 제안된 알고리즘적 및 아키텍처 최적화는 이전 접근법 대비 자원 사용을 줄이고 데이터 플로우 효율성을 향상시켰다.
  • 비정규 가중치 정제는 제로 스킵을 통해 상당한 속도 향상을 가져왔지만, MMD 거리로 측정된 생성 품질은 악화되었다.
  • 제안된 MMD 기반 최적화 지표(Eq. 6)는 성능-품질 균형점의 정점(peak)을 식별하여 균형 잡힌 희소성 선택을 가능하게 하였다.
  • FPGA 구현은 조건부 실행 상황에서도 안정적인 성능을 유지하는 반면, GPU는 이러한 워크로드에서 비효율성을 겪었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.