[논문 리뷰] Hardware Acceleration of LLMs: A comprehensive survey and comparison
이 논문은 대규모 언어 모델(Large Language Models, LLMs)용 하드웨어 가속기의 종합적인 서베이와 공정한 비교를 제시한다. 16nm 공정 기술을 기준으로 성능과 에너지 효율을 표준화하기 위해 외삽법을 사용한다. 현장 프로그래머블 게이트 어레이(FPGA), 애플리케이션 특화 통합 회로(ASIC), 그래픽 처리 장치(GPU), 그리고 메모리 내 가속기 아키텍처를 평가하며, ASIC이 최고의 성능(최대 363,647 GOPS)을 보이며, 메모리 내 가속기는 뛰어난 에너지 효율성을 제공함으로써 기술적 격차가 있는 다양한 플랫폼 간 정확한 비교가 가능하다는 것을 입증한다.
Large Language Models (LLMs) have emerged as powerful tools for natural language processing tasks, revolutionizing the field with their ability to understand and generate human-like text. In this paper, we present a comprehensive survey of the several research efforts that have been presented for the acceleration of transformer networks for Large Language Models using hardware accelerators. The survey presents the frameworks that have been proposed and then performs a qualitative and quantitative comparison regarding the technology, the processing platform (FPGA, ASIC, In-Memory, GPU), the speedup, the energy efficiency, the performance (GOPs), and the energy efficiency (GOPs/W) of each framework. The main challenge in comparison is that every proposed scheme is implemented on a different process technology making hard a fair comparison. The main contribution of this paper is that we extrapolate the results of the performance and the energy efficiency on the same technology to make a fair comparison; one theoretical and one more practical. We implement part of the LLMs on several FPGA chips to extrapolate the results to the same process technology and then we make a fair comparison of the performance.
연구 동기 및 목표
- 다양한 공정 기술을 사용하는 LLM 하드웨어 가속기 간 성능 비교가 공정하지 못한 문제를 해결하기 위해.
- 모든 가속기의 성능과 에너지 효율을 동일한 16nm 공정 기술로 외삽함으로써 표준화된 벤치마킹 프레임워크를 제공하기 위해.
- FPGA, ASIC, GPU, 메모리 내 플랫폼 간의 성능 및 에너지 효율을 평가하고 비교하기 위해.
- 연구자들이 LLM 가속기 설계나 선택 시 기술에 종속되지 않는 신뢰할 수 있는 기반을 제공하기 위해.
제안 방법
- 저자들은 이전 연구(예: Stillmaker & Baas, 2017)의 스케일링 방정식을 활용하여 성능 및 에너지 효율을 16nm 공정 기술로 외삽한다.
- 공개된 성능 데이터와 공정 노드 특성 정보를 기반으로 FPGA 및 ASIC 가속기의 이론적 외삽을 수행한다.
- 180nm에서 20nm까지 다양한 공정 노드를 가진 FPGA에서 VHDL 기반 행렬 곱셈 IP 코어를 사용하여 최대 클럭 주파수를 측정함으로써 실험적 검증을 수행한다.
- 실험 결과를 바탕으로 FPGA 기반 가속기의 이론적 외삽 모델을 검증하고 보정한다.
- 성능는 GOPS(giga operations per second)로, 에너지 효율은 GOPs/W로 정량화하여 플랫폼 간 비교를 가능하게 한다.
- 이 비교에는 Swin-T, Swin-B, Swin-S, BETA, Me-ViT, FTRANS, Via, STA-4, STA-8, AccelTran(에지/서버) ASIC 등 LLM을 대상으로 한 가속기들이 포함된다.

실험 결과
연구 질문
- RQ1어떻게 다양한 공정 기술을 가진 LLM 가속기의 성능 및 에너지 효율을 공정하게 비교할 수 있는가?
- RQ216nm 공정 노드로 표준화했을 때, FPGA-, ASIC-, GPU-, 메모리 내 기반 LLM 가속기의 상대적 성능 및 에너지 효율은 각각 어떻게 되는가?
- RQ3이론적 스케일링 모델은 다양한 공정 노드에서 FPGA 성능을 얼마나 정확하게 예측하는가?
- RQ4표준화 후, 어떤 하드웨어 플랫폼이 LLM 추론에서 가장 높은 절대 성능(GOPs)과 에너지 효율(GOPs/W)을 제공하는가?
- RQ5다양한 공정 노드를 가진 FPGA에서의 클럭 주파수 측정 결과는 이론적 외삽 모델을 뒷받침하는 데 어떤 기여를 하는가?
주요 결과
- 16nm로 외삽한 결과, AccelTran(서버) ASIC가 363,647 GOPS로 가장 높은 성능를 기록하여 다른 플랫폼을 압도적으로 앞선다.
- Me-ViT FPGA 가속기는 16nm에서 2,682 GOPS를 기록하여 FPGA 기반 설계의 높은 성능를 입증한다.
- BETA FPGA 가속기는 16nm에서 1,436 GOPS를 기록하여 주로 어텐션 연산이 많은 LLM 워크로드에 적합함을 시사한다.
- 메모리 내 가속기는 다른 플랫폼에 비해 뛰어난 에너지 효율성을 보이며, 이는 본 연구의 주요 초점은 절대 성능가 아닌 효율성임을 반영한다.
- 180nm에서 20nm까지의 실험적 FPGA 측정 결과는 이론적 스케일링 모델의 타당성을 확인하였으며, 공정 기술이 진전될수록 클럭 주파수가 예측 가능하게 감소하는 경향을 보였다.
- 연구는 원자적인 성능 데이터는 서로 다른 공정 노드에서 유도된 바, 기술 정규화 없이선 공정한 비교가 불가능하며, 따라서 기술 정규화가 필수적임을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.