[논문 리뷰] Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
이 논문은 BERT 및 GPT2 추론에서 이전 FPGA 가속기 대비 최대 16.1배의 성능 향상과 A100 GPU 대비 5.7배의 에너지 효율성 향상을 달성한 모델 특화 공간형 FPGA 가속기 모델을 제안한다. 이는 특정 연산자용 전용 하드웨어 유닛과 데이터플로우 아키텍처를 통해 외부 메모리 액세스를 최소화함으로써 효율적인 대규모 언어 모델(Large Language Model, LLM) 추론을 실현한다.
Recent advancements in large language models (LLMs) boasting billions of parameters have generated a significant demand for efficient deployment in inference workloads. The majority of existing approaches rely on temporal architectures that reuse hardware units for different network layers and operators. However, these methods often encounter challenges in achieving low latency due to considerable memory access overhead. This paper investigates the feasibility and potential of model-specific spatial acceleration for LLM inference on FPGAs. Our approach involves the specialization of distinct hardware units for specific operators or layers, facilitating direct communication between them through a dataflow architecture while minimizing off-chip memory accesses. We introduce a comprehensive analytical model for estimating the performance of a spatial LLM accelerator, taking into account the on-chip compute and memory resources available on an FPGA. Through our analysis, we can determine the scenarios in which FPGA-based spatial acceleration can outperform its GPU-based counterpart. To enable more productive implementations of an LLM model on FPGAs, we further provide a library of high-level synthesis (HLS) kernels that are composable and reusable. This library will be made available as open-source. To validate the effectiveness of both our analytical model and HLS library, we have implemented BERT and GPT2 on an AMD Alveo U280 FPGA device. Experimental results demonstrate our approach can achieve up to 13.4x speedup when compared to previous FPGA-based accelerators for the BERT model. For GPT generative inference, we attain a 2.2x speedup compared to DFX, an FPGA overlay, in the prefill stage, while achieving a 1.9x speedup and a 5.7x improvement in energy efficiency compared to the NVIDIA A100 GPU in the decode stage.
연구 동기 및 목표
- 외부 메모리 액세스 빈도가 높아 발생하는 고지연 및 고에너지 오버헤드로 인해 기존 시간적(FPGA) 아키텍처가 LLM 추론에서 성능 저하를 겪는 문제를 해결한다.
- 특정 모델에 최적화된 공간형 가속을 FPGA에서 실현 가능하고 성능 잠재력을 탐색한다.
- 공간형 가속기의 최적 병렬 처리 및 버퍼링 전략을 도출하기 위해 성능을 추정할 수 있는 분석 모델을 개발한다.
- 양자화된 LLM을 FPGA에서 빠르게 구현할 수 있도록 조합 가능하고 오픈소스인 HLS 커널 라이브러리를 구축한다.
- FPGA 기반 공간형 가속기가 저지연, 소규모 배치 추론 환경에서 GPU를 능가할 수 있음을 입증한다.
제안 방법
- 특정 연산자나 레이어를 위해 전용 처리 엔진(PE)을 갖춘 공간 아키텍처를 설계하여 스트리밍 버퍼를 통한 온칩 데이터플로우 통신을 가능하게 한다.
- 다중 FPGA 분산 추론을 지원하는 온칩 컴퓨팅 및 메모리 자원 기반의 성능 추정을 위한 종합적인 분석 모델을 개발한다.
- 고수준 합성(HLS) 커널 라이브러리를 활용해 AMD Alveo U280 FPGA에 BERT 및 GPT2를 구현하며, 이는 조합 가능하고 재사용 가능한 특성을 지닌다.
- 저비트 폭의 양자화, 고유 수치 유형, 희소성 최적화를 통해 효율성 향상과 메모리 대역폭 부담 감소를 도모한다.
- 데이터플로우 기반 파ip라인 처리를 통해 PE 간 동시 처리를 실현하고 외부 메모리 의존도를 감소시킨다.
- 분석 모델을 활용해 지연과 자원 효율성 측면에서 최적의 병렬 처리 및 버퍼링 전략을 도출한다.
실험 결과
연구 질문
- RQ1저지연, 소규모 배치 환경에서 FPGA 기반 공간 가속이 GPU 기반 추론보다 우월한 상황은 언제인가?
- RQ2특정 모델에 최적화된 FPGA 공간 아키텍처는 외부 메모리 액세스를 어떻게 최소화하고 지연 및 에너지 효율을 향상시킬 수 있는가?
- RQ3LLM 추론의 프리필 및 디코딩 단계에서 하드웨어 특화를 통해 완화할 수 있는 주요 병목 현상은 무엇인가?
- RQ4조합 가능한 HLS 커널 라이브러리는 다양한 LLM을 FPGA에 빠르고 고성능으로 구현하는 데 어떻게 기여하는가?
- RQ5공간형 FPGA 가속기의 최적 병렬 처리 및 버퍼링 전략는 무엇이며, 분석 모델을 통해 이를 어떻게 안내할 수 있는가?
주요 결과
- 제안된 FPGA 기반 공간 가속기는 Alveo U280 FPGA에서 BERT 추론에 대해 이전 FPGA 가속기 대비 최대 16.1배의 성능 향상을 달성한다.
- GPT2 생성형 추론에서 프리필 단계에서는 DFX(FPGA 오버레이) 대비 2.2배의 성능 향상을 기록한다.
- 디코딩 단계에서는 NVIDIA A100 GPU 대비 1.9배의 성능 향상과 5.7배의 에너지 효율성 향상을 확보한다.
- 분석 모델은 최적의 병렬 처리 및 버퍼링 전략을 성공적으로 식별하여 다중 FPGA에 걸친 효율적 확장 가능성을 보여준다.
- 오픈소스 HLS 커널 라이브러리는 조합 가능하고 고성능인 트랜스포머 커널의 구현을 가능하게 하여, 양자화된 LLM의 구현을 가속화한다.
- 메모리 액세스 오버헤드 감소와 효율적인 데이터플로우 실행 덕분에, FPGA 기반 공간 가속기는 저지연, 소규모 배치 추론 워크로드에서 GPU를 능가할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.