[논문 리뷰] Why is FPGA-GPU Heterogeneity the Best Option for Embedded Deep Neural Networks?
이 논문은 에너지 효율적인 추론을 위해 현장 프로그래머블 게이트 어레이(FPGA)와 그래픽 처리 장치(GPU)를 융합한 통합 가속 아키텍처를 제안한다. FPGA에 직접 하드웨어 매핑을 통해 에너지 효율성을 극대화하고, 복잡한 레이어는 GPU에 오프로드한다. SqueezeNet, MobileNetV2, ShuffleNetv2에서 평가한 결과, 통신 오버헤드를 고려한 후에도 GPU 전용 가속 대비 에너지 소비는 12–30% 감소하고 지연 시간은 4–26% 감소하였다.
Graphics Processing Units (GPUs) are currently the dominating programmable architecture for Deep Learning (DL) accelerators. The adoption of Field Programmable Gate Arrays (FPGAs) in DL accelerators is however getting momentum. In this paper, we demonstrate that Direct Hardware Mapping (DHM) of a Convolutional Neural Network (CNN) on an embedded FPGA substantially outperforms a GPU implementation in terms of energy efficiency and execution time. However, DHM is highly resource intensive and cannot fully substitute the GPU when implementing a state-of-the-art CNN. We thus propose a hybrid FPGA-GPU DL acceleration method and demonstrate that heterogeneous acceleration outperforms GPU acceleration even including communication overheads. Experimental results are conducted on a heterogeneous multi-platform setup embedding an Nvidia(R) Jetson TX2 CPU-GPU board and an Intel(R) Cyclone10GX FPGA board. The SqueezeNet, MobileNetv2, and ShuffleNetv2 mobile-oriented CNNs are experimented. We show that heterogeneous FPG-AGPU acceleration outperforms GPU acceleration for classification inference task over MobileNetv2 (12%-30% energy reduction, 4% to 26% latency reduction), SqueezeNet (21%-28% energy reduction, same latency), and ShuffleNetv2 (25% energy reduction, 21% latency reduction).
연구 동기 및 목표
- 제한된 전력 및 면적 예산을 가진 임베디드 딥 뉴럴 네트워크(DNN)에서 에너지 효율적인 추론에 대한 점점 커지는 수요를 해결한다.
- 강력하지만 모바일 및 임베디드 시스템에서 에너지 효율성이 최적화되지 않은 GPU 전용 가속의 한계를 극복한다.
- FPGA와 GPU를 융합하여 임베디드 DNN 워크로드에서 뛰어난 성능과 효율성을 달성할 수 있는 가능성과 이점을 탐색한다.
- 실제 임베디드 플랫폼에서 통신 오버헤드가 존재함에도 불구하고 하이브리드 FPGA-GPU 가속이 GPU 전용 가속을 능가함을 입증한다.
- 다양한 최신 모바일 중심의 컨volutional 네트워크(CNN)에 걸쳐 직접 하드웨어 매핑(DHM)과 GPU 가속 간의 성능 및 효율성의 상호 교환 조건을 평가한다.
제안 방법
- 에너지 효율성과 지연 시간 최소화를 위해 인텔 사이클론10GX FPGA에 컨volutional 레이어의 직접 하드웨어 매핑(DHM)을 구현한다.
- 깊이 분리형 컨볼루션 등 복잡하거나 최적화가 덜 된 레이어를 NVIDIA 재즈슨 TX2 플랫폼의 GPU에 오프로드한다.
- 계산 복잡도와 자원 가용성에 기반해 DNN 모델을 FPGA와 GPU 간에 동적으로 분할하는 이종 실행 파이프라인을 설계한다.
- 통신 오버헤드를 최소화하기 위해 효율적인 메모리 액세스 패턴과 저지연 통신 프rotocol를 사용해 FPGA와 GPU 간 데이터 전송을 최적화한다.
- 실제 성능과 에너지 소비를 평가하기 위해 재즈슨 TX2(CPU-GPU)와 사이클론10GX FPGA를 포함한 다중 플랫폼 환경을 구성한다.
- 동일한 워크로드 하에서 세 가지 모바일 최적화 CNN(SqueezeNet, MobileNetV2, ShuffleNetv2)에서 추론 성능을 벤치마킹한다.
실험 결과
연구 질문
- RQ1임베디드 DNN 추론에서 에너지 효율성과 지연 시간 측면에서 FPGA에 직접 하드웨어 매핑(DHM)이 GPU 전용 가속을 능가할 수 있는가?
- RQ2이종 임베디드 시스템에서 FPGA와 GPU 가속을 융합할 경우 성능 및 에너지 소비의 상호 교환 조건은 어떠한가?
- RQ3FPGA와 GPU 간의 통신 오버헤드는 하이브리드 DNN 추론 시스템의 전체 효율성에 어떤 영향을 미치는가?
- RQ4FPGA-GPU 이종성은 다양한 모바일 중심의 CNN 아키텍처에서 추론 성능을 얼마나 향상시킬 수 있는가?
- RQ5시스템 수준의 오버헤드를 고려할 때 하이브리드 FPGA-GPU 접근 방식이 GPU 전용 가속의 성능을 유지하거나 초월할 수 있는가?
주요 결과
- FPGA-GPU 이종 가속은 MobileNetV2에서 GPU 전용 추론 대비 에너지 소비를 12–30% 감소시켰다.
- 하이브리드 접근 방식은 통신 오버헤드를 고려한 후에도 MobileNetV2에서 지연 시간을 4–26% 감소시켰다.
- SqueezeNet의 경우, FPGA-GPU 시스템은 동일한 지연 시간을 유지하면서 에너지 소비를 21–28% 감소시켰다.
- ShuffleNetv2는 이종 가속기 사용 시 에너지 사용량이 25% 감소하고 지연 시간이 21% 감소하였다.
- 성능 향상은 다양한 모바일 최적화 CNN에 걸쳐 일관되게 나타나, FPGA-GPU 하이브리드 접근 방식의 일반성과 타당성을 입증한다.
- 결과적으로 통신 비용을 포함한 상황에서도 이종 가속이 GPU 전용 가속을 능가함을 보여주며, 임베디드 시스템에서 FPGA-GPU 공동 설계의 실현 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.