Skip to main content
QUICK REVIEW

[論文レビュー] Hardware Acceleration of LLMs: A comprehensive survey and comparison

Nikoletta Koilia, Christoforos Kachris|arXiv (Cornell University)|Sep 5, 2024
Parallel Computing and Optimization Techniques被引用数 4
ひとこと要約

本論文は、大規模言語モデル(LLMs)用ハードウェアアクセラレータの包括的かつ公平な比較を提示しており、特に16nmプロセス技術を基準として性能とエネルギー効率を標準化するための外挿法を用いている。FPGA、ASIC、GPU、およびメモリ内アーキテクチャを評価し、ASICが最高の性能(最大363,647 GOPS)を示す一方、メモリ内アクセラレータは優れたエネルギー効率を示し、技術的差異を考慮したより正確なクロスプラットフォームベンチマークが可能になることを示している。

ABSTRACT

Large Language Models (LLMs) have emerged as powerful tools for natural language processing tasks, revolutionizing the field with their ability to understand and generate human-like text. In this paper, we present a comprehensive survey of the several research efforts that have been presented for the acceleration of transformer networks for Large Language Models using hardware accelerators. The survey presents the frameworks that have been proposed and then performs a qualitative and quantitative comparison regarding the technology, the processing platform (FPGA, ASIC, In-Memory, GPU), the speedup, the energy efficiency, the performance (GOPs), and the energy efficiency (GOPs/W) of each framework. The main challenge in comparison is that every proposed scheme is implemented on a different process technology making hard a fair comparison. The main contribution of this paper is that we extrapolate the results of the performance and the energy efficiency on the same technology to make a fair comparison; one theoretical and one more practical. We implement part of the LLMs on several FPGA chips to extrapolate the results to the same process technology and then we make a fair comparison of the performance.

研究の動機と目的

  • 異なるプロセス技術に起因する不公平なLLMハードウェアアクセラレータの性能比較の課題に対処すること。
  • 共通の16nmプロセス技術に性能とエネルギー効率を外挿することで、標準化されたベンチマークフレームワークを提供すること。
  • FPGA、ASIC、GPU、およびメモリ内プラットフォーム間のアクセラレータの性能とエネルギー効率を評価・比較すること。
  • 研究者がLLMアクセラレータの選定や設計に際して、技術に依存しない信頼性の高い基盤を得られるようにすること。

提案手法

  • 著者らは、先行研究(例:Stillmaker & Baas, 2017)のスケーリング式を用い、性能とエネルギー効率を16nmプロセス技術に外挿している。
  • 公開済みの性能データとプロセスノードの特性を用いて、FPGAおよびASICアクセラレータの理論的外挿を実施している。
  • 180nmから20nmまでの異なるプロセスノードを有するFPGA上にVHDLベースの行列乗算IPコアを実装し、最大クロック周波数を測定することで、実験的検証を実施している。
  • 実験結果をもとに、FPGAベースアクセラレータの理論的外挿モデルの妥当性を検証・精緻化している。
  • 性能はGOPS(1秒あたりのギガ演算数)で、エネルギー効率はGOPS/Wで定量化され、クロスプラットフォーム比較が可能になっている。
  • 本研究には、Swin-T、Swin-B、Swin-S、BETA、Me-ViT、FTRANS、Via、STA-4、STA-8、およびAccelTran(エッジ/サーバー用)ASICなど、LLMをターゲットとしたアクセラレータが含まれている。
Figure 1: Performance per process technology
Figure 1: Performance per process technology

実験結果

リサーチクエスチョン

  • RQ1どのようにして、異なるプロセス技術に起因するLLMアクセラレータの性能とエネルギー効率を公平に比較できるか?
  • RQ216nmプロセスノードに標準化した場合、FPGA、ASIC、GPU、およびメモリ内ベースのLLMアクセラレータの相対的な性能とエネルギー効率はそれぞれどのようになるか?
  • RQ3理論的スケーリングモデルは、異なるプロセスノードにおけるFPGA性能をどの程度正確に予測できるか?
  • RQ4技術標準化後、どのハードウェアプラットフォームが最高の絶対的性能(GOPS)とエネルギー効率(GOPS/W)を達成するか?
  • RQ5異なるプロセスノードを有するFPGAにおけるクロック周波数の実験的測定は、理論的外挿をどの程度支持するか?

主な発見

  • 16nmに外挿した結果、AccelTran(サーバー用)ASICは363,647 GOPSの最高性能を達成し、他のプラットフォームを大きく上回った。
  • Me-ViT FPGAアクセラレータは16nmで2,682 GOPSを達成し、FPGAベース設計の高い性能を示した。
  • BETA FPGAアクセラレータは16nmで1,436 GOPSを達成し、アテンション中心のLLMワークロードに強く適した性能を示した。
  • メモリ内アクセラレータは他のプラットフォームに比べて優れたエネルギー効率を示したが、本研究の焦点は絶対的性能ではなくエネルギー効率にあった。
  • 180nmから20nmまでのFPGAにおける実験的測定結果は、理論的スケーリングモデルの妥当性を裏付けた。クロック周波数はプロセス技術のスケーリングに伴い予測通りに低下した。
  • 本研究は、技術の標準化がなければ、アクセラレータ間の公平な比較は不可能であり、異なるプロセスノードから得られる生の性能データは誤解を招く可能性があることを示している。
Figure 2: Performance (Log) per process technology
Figure 2: Performance (Log) per process technology

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。