Skip to main content
QUICK REVIEW

[論文レビュー] Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference

Hongzheng Chen, Jiahao Zhang|arXiv (Cornell University)|Dec 23, 2023
Topic Modeling参考文献 76被引用数 4
ひとこと要約

本稿では、特定のモデル向けに最適化された空間的FPGAアクセラレータを提案し、演算子専用のハードウェアユニットとデータフロー・アーキテクチャを用いて、外部メモリへのアクセスを最小限に抑えることで、大規模言語モデル(LLM)推論の効率化を図る。BERTの推論においては、先行するFPGAアクセラレータ比で最大16.1倍の高速化を達成し、GPT2のデコード推論においてはA100 GPUと比較して5.7倍のエネルギー効率の向上を達成した。

ABSTRACT

Recent advancements in large language models (LLMs) boasting billions of parameters have generated a significant demand for efficient deployment in inference workloads. The majority of existing approaches rely on temporal architectures that reuse hardware units for different network layers and operators. However, these methods often encounter challenges in achieving low latency due to considerable memory access overhead. This paper investigates the feasibility and potential of model-specific spatial acceleration for LLM inference on FPGAs. Our approach involves the specialization of distinct hardware units for specific operators or layers, facilitating direct communication between them through a dataflow architecture while minimizing off-chip memory accesses. We introduce a comprehensive analytical model for estimating the performance of a spatial LLM accelerator, taking into account the on-chip compute and memory resources available on an FPGA. Through our analysis, we can determine the scenarios in which FPGA-based spatial acceleration can outperform its GPU-based counterpart. To enable more productive implementations of an LLM model on FPGAs, we further provide a library of high-level synthesis (HLS) kernels that are composable and reusable. This library will be made available as open-source. To validate the effectiveness of both our analytical model and HLS library, we have implemented BERT and GPT2 on an AMD Alveo U280 FPGA device. Experimental results demonstrate our approach can achieve up to 13.4x speedup when compared to previous FPGA-based accelerators for the BERT model. For GPT generative inference, we attain a 2.2x speedup compared to DFX, an FPGA overlay, in the prefill stage, while achieving a 1.9x speedup and a 5.7x improvement in energy efficiency compared to the NVIDIA A100 GPU in the decode stage.

研究の動機と目的

  • 頻繁な外部メモリアクセスに起因する、時間的FPGAアーキテクチャにおけるLLM推論の高遅延および高エネルギー消費を解消すること。
  • 演算子専用のプロセッシングエンジンを用いた、FPGA上でのモデル特化型空間的アクセラレーションの実現可能性と性能ポテンシャルを調査すること。
  • 空間的アクセラレータの最適並列処理およびバッファリング戦略を導くために、パフォーマンスを推定する解析的モデルの構築。
  • 量子化されたLLMのFPGA上でのデプロイを加速する、組み立て可能でオープンソースのHLSカーネルライブラリの開発。
  • FPGAベースの空間的アクセラレータが、低遅延・小バッチ推論シナリオにおいてGPUを上回ることを実証すること。

提案手法

  • 特定の演算子や層に特化したプロセッシングエンジン(PE)を備えた空間的アーキテクチャを設計し、ストリーミングバッファを介したオンチップデータフロー通信を可能にした。
  • オンチップの計算およびメモリリソースに基づいてパフォーマンスを推定する包括的な解析的モデルを構築し、マルチFPGA分散推論をサポートした。
  • AMD Alveo U280 FPGA上にBERTおよびGPT2を実装し、組み立て可能で再利用可能なHLSカーネルのライブラリを用いた。
  • 低ビット幅の量子化、カスタム数値型、スパarsityの最適化により、効率性を向上させ、メモリ帯域幅の圧力を軽減した。
  • データフロー形式のパイプライン処理を活用し、PE間での並列処理を可能にし、外部メモリへの依存度を低減した。
  • 解析的モデルを用いて、遅延およびリソース効率の両面で最適な並列処理およびバッファリング戦略を同定した。

実験結果

リサーチクエスチョン

  • RQ1FPGAベースの空間的アクセラレーションは、特に低遅延・小バッチ環境下で、GPUベースの推論をどのように上回るのか?
  • RQ2FPGA上でのモデル特化型空間的アーキテクチャは、どのように外部メモリアクセスを最小限に抑え、遅延とエネルギー効率を向上させるのか?
  • RQ3LLM推論のプレフィルおよびデコードステージにおける主なボトル neck は何か? そして、それらはハードウェア特化によってどのように緩和可能か?
  • RQ4組み立て可能なHLSカーネルライブラリは、FPGA上での多様なLLMの迅速かつ高性能なデプロイをどのように可能にするか?
  • RQ5空間的FPGAアクセラレータにおける最適な並列処理およびバッファリング戦略は何か? そして、それらは解析的モデリングによってどのように導けるか?

主な発見

  • 提案されたFPGAベースの空間的アクセラレータは、Alveo U280 FPGA上でのBERT推論において、先行するFPGAアクセラレータ比で最大16.1倍の高速化を達成した。
  • GPT2の生成的推論において、プレフィルステージでDFX(FPGAオーバーレイ)と比較して2.2倍の高速化を達成した。
  • デコードステージでは、FPGAアクセラレータが1.9倍の高速化と、NVIDIA A100 GPUと比較して5.7倍のエネルギー効率の向上を達成した。
  • 解析的モデルは、最適な並列処理およびバッファリング戦略を的確に同定でき、複数FPGAにわたる効率的なスケーリングを可能にした。
  • オープンソースのHLSカーネルライブラリにより、Transformerカーネルの組み立て可能で高性能な実装が可能となり、量子化されたLLMのデプロイが加速された。
  • FPGA上での空間的アクセラレーションは、メモリアクセスのオーバーヘッドが低く、効率的なデータフロー実行が可能であるため、遅延に敏感で小バッチの推論ワークロードにおいてGPUを上回ることが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。