[논문 리뷰] A Survey on Hardware Accelerators for Large Language Models
이 종합 조사에서는 대규모 언어 모델(Large Language Models, LLMs)을 위한 하드웨어 가속기인 GPU, FPGA, ASIC, 그리고 메모리 내 계산 아키텍처를 종합적으로 분석한다. 연구 결과, ASIC과 메모리 내 가속기는 CPU 대비 최대 347배의 성능 향상과 4개의 지수 단위 높은 에너지 효율성을 달성하는 것으로 밝혀졌으며, FPGA는 낮은 비용이면서도 여전히 유의미한 성능 향상을 제공하는 실용적이고 재구성 가능한 대안을 제공한다.
Large Language Models (LLMs) have emerged as powerful tools for natural language processing tasks, revolutionizing the field with their ability to understand and generate human-like text. As the demand for more sophisticated LLMs continues to grow, there is a pressing need to address the computational challenges associated with their scale and complexity. This paper presents a comprehensive survey on hardware accelerators designed to enhance the performance and energy efficiency of Large Language Models. By examining a diverse range of accelerators, including GPUs, FPGAs, and custom-designed architectures, we explore the landscape of hardware solutions tailored to meet the unique computational demands of LLMs. The survey encompasses an in-depth analysis of architecture, performance metrics, and energy efficiency considerations, providing valuable insights for researchers, engineers, and decision-makers aiming to optimize the deployment of LLMs in real-world applications.
연구 동기 및 목표
- 점점 더 크고 복잡해지는 LLMs가 데이터 센터에서 증가하는 계산 및 에너지 수요를 해결하기 위해.
- Transformer에서 가장 계산이 집약적인 연산, 예를 들어 행렬 곱셈에 특화된 하드웨어 가속기를 체계적으로 평가하기 위해.
- GPU, FPGA, ASIC, 메모리 내 아키텍처를 포함한 다양한 플랫폼 간 성능, 성능 향상, 에너지 효율성에 대한 비교 분석을 제공하기 위해.
- 실제 구현 환경에서 맞춤형 가속기(예: ASIC)와 재구성 가능한 플랫폼(예: FPGA) 간의 상호 상충 관계를 규명하기 위해.
- 성능, 비용, 에너지 효율성 기반으로 연구자 및 엔지니어가 LLM의 효율적 배포를 위한 최적의 하드웨어 솔루션을 선택할 수 있도록 안내하기 위해.
제안 방법
- Transformer 기반 모델에 초점을 맞춘 LLM 하드웨어 가속기 관련 240篇 이상의 연구 논문을 종합적으로 조사한다.
- 기술 기반(_GPU, FPGA, ASIC, 메모리 내_)으로 가속기를 분류하고 성능 향상, 에너지 효율성, 구현 가능성 기준으로 평가한다.
- 실물로 제작되지 않은 경우에도 사이클 정확도 시뮬레이션 및 전력 추정 도구(예: CACTI)를 사용해 ASIC 및 메모리 내 설계를 평가한다.
- 기준 플랫폼(CPU, GPU)과의 비교를 통해 상대적 성능를 평가하며, 기준 구성의 다양성에 주의를 기울인다.
- 가속기 설계에 통합된 알고리즘 최적화(예: 희소성, 양자화, 저정밀도 계산)가 효율성 향상에 기여하는 방식을 분석한다.
- MNNFast와 같은 핵심 프레임워크의 다중 플랫폼 구현(CPU, GPU, FPGA)을 평가하여 플랫폼 간 일관성과 이식 가능성의 정도를 입증한다.

실험 결과
연구 질문
- RQ1LLM 추론을 위한 GPU, FPGA, ASIC, 메모리 내 계산 가속기 간 주요 아키텍처적 및 성능적 차이점은 무엇인가?
- RQ2일반 목적의 CPU와 GPU에 비해 하드웨어 가속기가 Transformer 기반 LLM의 성능 향상과 에너지 효율성 향상에 어떻게 기여하는가?
- RQ3고성능, 고비용의 맞춤형 ASIC과 성능는 낮지만 빠른 구현이 가능한 재구성 가능한 FPGA 간의 상호 상충 관계는 무엇인가?
- RQ4알고리즘 최적화(예: 희소성, 양자화)가 하드웨어 가속기에서 에너지 효율성 향상에 얼마나 기여할 수 있는가?
- RQ5NVM 및 메모리스터 기반 메모리 내 계산과 같은 신기술의 LLM 가속 분야에서 실용적 제약과 상용화 장벽은 무엇인가?
주요 결과
- ASIC 기반 가속기는 CPU 기준 기준 플랫폼 대비 최대 347배의 성능 향상을 기록했으며, SpAtten가 가장 높은 보고된 성능 향상을 기록했다.
- 메모리 내 계산 가속기는 CPU 대비 최대 200배의 성능 향상과 4개의 지수 단위 높은 에너지 효율성 향상을 달성했으며, MNNFast는 다중 플랫폼 간 일관성을 보였다.
- FPGA 기반 가속기인 FTrans는 최대 81배의 성능 향상을 기록했으며, 낮은 초기 투자 비용과 빠른 구현이 가능한 실용적이고 재구성 가능한 대안을 제공한다.
- ASIC 및 메모리 내 가속기는 CPU 대비 최대 4개의 지수 단위, GPU 대비 최대 3개의 지수 단위의 에너지 소비 감소를 이룩했으며, 이는 탄소 배출 및 냉각 수요 감소에 기여한다.
- 높은 성능에도 불구하고 ASIC과 메모리 내 솔루션은 장기적인 개발 주기와 높은 제조 비용으로 인해 광범위한 보급이 제한된다.
- FPGA는 빠른 프로토타ип링과 기존 데이터 센터 인fra구조에의 통합이 가능하며, 측정 가능한 성능 향상과 에너지 효율성 향상을 제공하는 실용적인 중간 다리 역할을 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.