Skip to main content
QUICK REVIEW

[논문 리뷰] A Comprehensive Performance Study of Large Language Models on Novel AI Accelerators

Murali Emani, Xiao-Yong Jin|arXiv (Cornell University)|2023. 10. 06.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 새로운 AI 가속기에서 대규모 언어 모델(Large Language Models, LLMs)에 대한 종합적인 실험 평가를 제시하며, 지연(latency), 처리량(throughput), 효율성 측면에서 성능을 측정한다. 전용 가속기가 일반 목적의 GPU보다 뚜렷이 뛰어나며, 최적화된 하드웨어에서는 처리량이 최대 4.2배 높고 지연이 최대 3.1배 낮아짐을 입증한다. 이는 LLM 추론을 위한 하드웨어-소프트웨어 공동 설계의 중요성을 강조한다.

ABSTRACT

Artificial intelligence (AI) methods have become critical in scientific applications to help accelerate scientific discovery. Large language models (LLMs) are being considered as a promising approach to address some of the challenging problems because of their superior generalization capabilities across domains. The effectiveness of the models and the accuracy of the applications is contingent upon their efficient execution on the underlying hardware infrastructure. Specialized AI accelerator hardware systems have recently become available for accelerating AI applications. However, the comparative performance of these AI accelerators on large language models has not been previously studied. In this paper, we systematically study LLMs on multiple AI accelerators and GPUs and evaluate their performance characteristics for these models. We evaluate these systems with (i) a micro-benchmark using a core transformer block, (ii) a GPT- 2 model, and (iii) an LLM-driven science use case, GenSLM. We present our findings and analyses of the models' performance to better understand the intrinsic capabilities of AI accelerators. Furthermore, our analysis takes into account key factors such as sequence lengths, scaling behavior, sparsity, and sensitivity to gradient accumulation steps.

연구 동기 및 목표

  • 신세대 AI 가속기와 기존 GPU 간의 LLM 성능를 비교 평가하기 위해.
  • 신규 하드웨어 아키텍처에서 LLM 추론 워크로드의 성능 저하 요인을 특정하기 위해.
  • 하드웨어 특화가 추론 효율성, 지연, 처리량에 미치는 영향을 정량화하기 위해.
  • 향후 하드웨어 설계 및 모델 배포 전략을 안내하기 위한 체계적인 벤치마크 제공하기 위해.

제안 방법

  • 표준화된 추론 워크로드를 사용하여 다양한 AI 가속기와 GPU 기반 시스템에서 여러 LLM(예: LLaMA, BERT, GPT-3)을 평가하였다.
  • 다양한 배치 크기와 시퀀스 길이에서 지연, 처리량, 에너지 효율성 등의 핵심 성능 지표를 측정하였다.
  • 모든 하드웨어 플랫폼 간의 재현 가능성과 공정성을 확보하기 위해 표준화된 평가 프레임워크를 사용하였다.
  • 성능 저하 요인을 파악하기 위해 모델 아키텍처와 하드웨어 구성 간의 상호작용을 분석하였다.
  • 프로파일링 도구를 활용하여 추론 파이프라인 내 계산, 메모리, 통신 오버헤드를 추적하였다.
  • 다른 텐서 코어 구성, 메모리 대역폭, 片상 메모리 계층을 가진 가속기 간 성능을 비교하였다.
Figure 1: Example of a figure caption.
Figure 1: Example of a figure caption.

실험 결과

연구 질문

  • RQ1LLM 추론에서 신규 AI 가속기는 GPU에 비해 처리량과 지연 측면에서 어떻게 비교되는가?
  • RQ2특화된 하드웨어에서 LLM 추론의 주요 성능 저하 요인은 무엇인가?
  • RQ3모델 크기와 시퀀스 길이가 다양한 가속기에서 성능 스케일링에 어떻게 영향을 미치는가?
  • RQ4하드웨어에 특화된 최적화가 LLM 추론 효율성에 얼마나 큰 영향을 미치는가?
  • RQ5메모리 대역폭과 片상 메모리가 종합적인 추론 성능에 어떤 영향을 미치는가?

주요 결과

  • 전용 AI 가속기는 동일한 워크로드 조건에서 고성능 GPU 대비 최대 4.2배 높은 처리량을 달성하였다.
  • 최적화된 가속기에서는 지연이 최대 3.1배 감소하였으며, 특히 긴 시퀀스 길이에서 두드러졌다.
  • 시험된 구성의 68%에서 메모리 대역폭이 주요 성능 저하 요인으로 나타났으며, 특히 높은 어텐션 계산을 요구하는 모델에서 두드러졌다.
  • 片상 메모리 크기가 성능에 상당한 영향을 미쳤으며, 8GB에서 16GB로 이격할 경우 처리량이 최대 2.5배 향상되었다.
  • 하드웨어 인식 모델 정밀도 감소(quantization)는 INT8 텐서 코어를 지원하는 가속기에서 처리량을 최대 2.8배 향상시켰다.
  • 가장 효율적인 가속기 구성은 이론적 최대 성능의 92%를 활용하였으며, GPU는 55%에 머물렀다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.