[논문 리뷰] DFX: A Low-latency Multi-FPGA Appliance for Accelerating Transformer-based Text Generation
DFX는 모델 병렬 처리, 최적화된 데이터 플로우를 가진 고유한 계산 코어, 고대역폭 메모리(HBM)의 전면 활용을 통해 저지연, 고스루풋으로 종단 간 GPT-2 추론을 가속화하는 다중-FPGA 장치이다. 네 대의 Xilinx Alveo U280 FPGA를 사용하는 다중-GPU 기반 대비 5.58× 성능 향상, 3.99× 뛰어난 에너지 효율성, 8.21× 높은 비용 효율성 달성.
Transformer is a deep learning language model widely used for natural language processing (NLP) services in datacenters. Among transformer models, Generative Pre-trained Transformer (GPT) has achieved remarkable performance in text generation, or natural language generation (NLG), which needs the processing of a large input context in the summarization stage, followed by the generation stage that produces a single word at a time. The conventional platforms such as GPU are specialized for the parallel processing of large inputs in the summarization stage, but their performance significantly degrades in the generation stage due to its sequential characteristic. Therefore, an efficient hardware platform is required to address the high latency caused by the sequential characteristic of text generation. In this paper, we present DFX, a multi-FPGA acceleration appliance that executes GPT-2 model inference end-to-end with low latency and high throughput in both summarization and generation stages. DFX uses model parallelism and optimized dataflow that is model-and-hardware-aware for fast simultaneous workload execution among devices. Its compute cores operate on custom instructions and provide GPT-2 operations end-to-end. We implement the proposed hardware architecture on four Xilinx Alveo U280 FPGAs and utilize all of the channels of the high bandwidth memory (HBM) and the maximum number of compute resources for high hardware efficiency. DFX achieves 5.58x speedup and 3.99x energy efficiency over four NVIDIA V100 GPUs on the modern GPT-2 model. DFX is also 8.21x more cost-effective than the GPU appliance, suggesting that it is a promising solution for text generation workloads in cloud datacenters.
연구 동기 및 목표
- Transformer 기반 텍스트 생성의 순차적 생성 단계에서 GPU 기반 시스템의 높은 지연을 해결하기 위해.
- 요약 및 생성 단계 모두에서 종단 간 GPT 추론을 지원하는 통합형 프로그래머블 하드웨어 플랫폼을 설계하기 위해.
- 다중-FPGA 시스템에서 HBM 대역폭과 계산 자원을 전면 활용하여 하드웨어 활용도를 극대화하기 위해.
- 데이터센터 규모의 텍스트 생성 워크로드에서 비용 효율성과 에너지 효율성을 향상시키기 위해.
- ASIC 재설계 비용 없이 진화하는 Transformer 모델을 위한 재구성 가능하고 확장 가능한 솔루션을 제공하기 위해.
제안 방법
- DFX는 네 대의 Xilinx Alveo U280 FPGA에 걸쳐 모델 병렬 처리를 적용하여 GPT-2 워크로드를 균일하게 분산하고 계산 용량을 확장한다.
- 단일 토큰 생성을 위해 최적화된 고유한 프로그래머블 계산 코어를 사용하여 본질적으로 순차적인 생성 단계에서 높은 활용도를 달성한다.
- 효율적인 타일링 기법과 GPT에 특화된 데이터 플로우로 HBM2 대역폭 사용을 극대화하여 메모리 병목 현상을 줄인다.
- 주요 GPT-2 연산, 특히 어텐션 계산, 레이어 정규화, 잔여 연결을 가속화하기 위해 고유 명령어를 활용한다.
- HBM2(460 GB/s)와 모든 이용 가능한 DSP 및 BRAM 자원을 전면 활용하여 높은 하드웨어 효율성을 확보한다.
- 설계는 완전히 재프로그래밍 가능하여, 최소한의 재설계 오버헤드로 진화하는 Transformer 아키텍처에 효과적으로 대응할 수 있다.
실험 결과
연구 질문
- RQ1하드웨어 가속기로 GPT 기반 텍스트 생성의 순차적 생성 단계에서 지연을 어떻게 줄일 수 있는가? 이 단계에서 GPU는 성능이 열 劣하다.
- RQ2Transformer 추론을 위한 다중-FPGA 배포에서 고스루풋과 저지연을 달성하기 위해 어떤 시스템 수준 최적화가 필요한가?
- RQ3메모리 집약적인 Transformer 모델, 예를 들어 GPT-2와 같은 모델에서 다중-FPGA 시스템에서 HBM2 대역폭을 어떻게 극대화할 수 있는가?
- RQ4데이터센터 워크로드에서 GPU 기반 대비 재구성 가능한 FPGA 기반 장치가 성능, 에너지 소비, 비용 면에서 어떤 이점을 제공하는가?
- RQ5모델 병렬 처리와 고유 명령어 세트, 데이터 플로우 최적화를 조합하여 고도로 하드웨어 활용도를 달성하면서 GPT-2의 종단 간 가속을 달성할 수 있는가?
주요 결과
- DFX는 네 대의 NVIDIA V100 GPU를 사용하는 다중-GPU 기반 대비 GPT-2 모델에서 5.58× 성능 향상 달성.
- GPU 기반 장치 대비 3.99× 뛰어난 에너지 효율성 확보.
- GPU 장치 대비 8.21× 더 높은 비용 효율성 확보, 초도 비용은 낮고 성능 대비 비용은 높음.
- 네 대의 U280 FPGA에서 모든 HBM2 채널과 계산 자원을 전면 활용하여 높은 하드웨어 효율성 달성.
- 고유한 계산 코어와 최적화된 데이터 플로우로 요약 단계와 순차적 생성 단계 모두에서 고스루풋과 저지연 구현.
- 재구성 가능한 FPGA 설계로 진화하는 Transformer 모델에 효율적으로 대응 가능하며 ASIC 재설계가 필요 없음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.