Skip to main content
QUICK REVIEW

[논문 리뷰] Heterogeneous FPGA+GPU Embedded Systems: Challenges and Opportunities

Mohammad Hosseinabady, Mohd Amiruddin Zainol|arXiv (Cornell University)|2019. 01. 18.
Parallel Computing and Optimization Techniques참고 문헌 22인용 수 4
한 줄 요약

이 논문은 엣지 컴퓨팅에서 성능과 에너지 효율성을 최적화하기 위해 이종 FPGA+GPU 임베디드 시스템을 제안한다. FPGA 가속을 위한 스트림 컴퓨팅 프레임워크, 성능/에너지 모델링 기법, 그리고 동적 작업 스케줄링 전략을 도입하여, 이미지 히스토ограм, 밀도 높은, 희소 행렬-벡터 곱셈 워크로드에서 양 코어가 병렬로 실행될 경우 1.79배의 성능 향상과 2.29배의 에너지 효율성 향상을 달성한다.

ABSTRACT

The edge computing paradigm has emerged to handle cloud computing issues such as scalability, security and low response time among others. This new computing trend heavily relies on ubiquitous embedded systems on the edge. Performance and energy consumption are two main factors that should be considered during the design of such systems. Focusing on performance and energy consumption, this paper studies the opportunities and challenges that a heterogeneous embedded system consisting of embedded FPGAs and GPUs (as accelerators) can provide for applications. We study three design, modeling and scheduling challenges throughout the paper. We also propose three techniques to cope with these three challenges. Applying the proposed techniques to three applications including image histogram, dense matrix-vector multiplication and sparse matrix-vector multiplications show 1.79x and 2.29x improvements in performance and energy consumption, respectively, when both FPGA and GPU execute the corresponding application in parallel.

연구 동기 및 목표

  • IoT 및 임베디드 시스템에서 고성능, 저에너지 엣지 컴퓨팅의 증가하는 수요를 충족시키기 위해.
  • 최적의 성능과 에너지 효율성을 확보하기 위해 이종 FPGA+GPU 시스템의 설계, 모델링, 스케줄링 과제를 극복하기 위해.
  • 임베디드 FPGA와 GPU 간의 효율적 태스크 오프로딩을 가능하게 하는 체계적인 방법론을 개발하기 위해.
  • 실세계 워크로드인 이미지 처리 및 희소/밀도 높은 행렬 연산에서 협업 실행의 이점을 입증하기 위해.

제안 방법

  • 다양한 응용 프로그램을 임베디드 FPGA에 효율적으로 매핑하기 위해 고수준 합성(HLS) 도구를 사용한 스트림 컴퓨팅 엔진을 제안한다.
  • FPGA 및 GPU 워크로드의 실행 특성을 예측하기 위한 성능 및 전력 모델링 기법을 개발한다.
  • 데이터 크기와 플랫폼 능력에 기반해 워크로드를 FPGA와 GPU 간에 분할하는 동적 작업 스케줄링 알고리즘을 설계한다.
  • 이 프레임워크를 이미지 히스토ограм, 밀도 높은 행렬-벡터 곱셈(DeMV), 희소 행렬-벡터 곱셈(SpMV)의 세 응용 프로그램에 구현하고 평가한다.
  • PCIe 오버헤드를 제거하고 메모리 대역폭 활용도를 향상시키기 위해 공유 주소 공간을 통한 제로 코피 메모리 액세스를 사용한다.
  • FPGA 설계에서 루프 편집 및 파ip라이닝 기법을 적용하여 고처리량과 낮은 기동 간격(II=1)을 달성한다.

실험 결과

연구 질문

  • RQ1이종 FPGA+GPU 임베디드 시스템은 단독 가속기보다 어떻게 더 높은 성능과 에너지 효율성을 달성할 수 있는가?
  • RQ2HLS 도구를 사용한 체계적인 설계 방법론은 다양한 워크로드에 대한 효율적 FPGA 가속을 어떻게 가능하게 하는가?
  • RQ3공유 메모리 임베디드 시스템에서 FPGA 및 GPU 구성 요소의 성능과 에너지 소비를 정확하게 모델링하는 방법은 무엇인가?
  • RQ4실행 시간과 에너지 소비를 최소화하기 위해 병렬 작업을 FPGA와 GPU 간에 최적의 전략으로 어떻게 분할할 수 있는가?

주요 결과

  • 제안된 FPGA+GPU 협업은 GPU 전용 실행 대비 1.79배의 성능 향상과 2.29배의 에너지 효율성 향상을 달성한다.
  • 이미지 히스토ограм 워크로드에서 Zynq MPSoC FPGA는 Jetson TX1 GPU보다 상당히 적은 전력을 소비한다(최대 5.2배 적음).
  • DeMV 응용 프로그램은 Zynq와 Jetson 간에 작업을 분할할 경우 GPU 전용 실행 대비 1.48배의 성능 향상과 1.19배의 에너지 효율성 향상을 보인다.
  • 대용량 데이터 크기에서 SpMV 워크로드는 Jetson에서 Zynq MPSoC 대비 3.2배의 성능 향상을 기록하며, FPGA와 GPU를 함께 사용할 경우 1.46배의 성능 향상과 1.23배의 에너지 효율성 향상을 달성한다.
  • 루프 편집 이후 FPGA 기반 설계는 II=1을 달성하여 최대 처리량을 확보하고 파이프라인 병목 현상을 제거한다.
  • 제로 코피 액세스를 통한 공유 메모리 아키텍처는 프로세서 간 통신 오버헤드를 감소시키고 메모리 대역폭 활용도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.