Skip to main content
QUICK REVIEW

[論文レビュー] Splitwise: Efficient generative LLM inference using phase splitting

Pratyush Patel, Esha Choukse|arXiv (Cornell University)|Nov 30, 2023
Topic Modeling被引用数 6
ひとこと要約

Splitwiseは、計算負荷の高いプロンプト処理とメモリ負荷の高いトークン生成を、別々の専用マシンに分離することで、生成的LLM推論のスループットを向上させ、コストを削減し、消費電力を低減する。高帯域幅インターコネクトを活用した状態転送の最適化により、ベースライン設計と同一のコストと電力予算でも最大2.35倍のスループットを達成する。

ABSTRACT

Recent innovations in generative large language models (LLMs) have made their applications and use-cases ubiquitous. This has led to large-scale deployments of these models, using complex, expensive, and power-hungry AI accelerators, most commonly GPUs. These developments make LLM inference efficiency an important challenge. Based on our extensive characterization, we find that there are two main phases during an LLM inference request: a compute-intensive prompt computation, and a memory-intensive token generation, each with distinct latency, throughput, memory, and power characteristics. Despite state-of-the-art batching and scheduling, the token generation phase underutilizes compute resources. Specifically, unlike compute-intensive prompt computation phases, token generation phases do not require the compute capability of the latest GPUs, and can be run with lower power and cost. With Splitwise, we propose splitting the two phases of a LLM inference request on to separate machines. This allows us to use hardware that is well-suited for each phase, and provision resources independently per phase. However, splitting an inference request across machines requires state transfer from the machine running prompt computation over to the machine generating tokens. We implement and optimize this state transfer using the fast back-plane interconnects available in today's GPU clusters. We use the Splitwise technique to design LLM inference clusters using the same or different types of machines for the prompt computation and token generation phases. Our clusters are optimized for three key objectives: throughput, cost, and power. In particular, we show that we can achieve 1.4x higher throughput at 20% lower cost than current designs. Alternatively, we can achieve 2.35x more throughput with the same cost and power budgets.

研究の動機と目的

  • 高価なGPUにプロンプト計算とトークン生成の両方を統合してデプロイする際の非効率性、特に計算リソースの未利用と高コストを是正すること。
  • LLM推論における計算とメモリワークロードを分離することで、各フェーズに特化したハードウェアを検討すること。
  • フェーズ別に最適化されたハードウェア提供と低遅延状態転送を活用し、システムスループット、コスト、電力効率を最適化すること。
  • 統合型GPUベースの推論クラスターよりも、パフォーマンス/ドル(Perf/$)およびパフォーマンス/ワット(Perf/W)の観点で優れた性能を達成できることを示すこと。
  • 実際のプロダクション推論トレースを用いて、多様なワークロード、モデルタイプ、システム構成において、このアプローチの有効性を検証すること。

提案手法

  • Splitwiseは、各LLM推論リクエストを2段階に分割する:並列処理で計算負荷の高いプロンプト計算フェーズと、逐次処理でメモリ制限の高いトークン生成フェーズ。両者は別々のマシンで実行される。
  • Infinibandなどの高速インターコネクトを介して、キーバリューキャッシュ(KVキャッシュ)をブロック単位で最適化してプロンプトマシンからトークン生成マシンに転送することで、遅延を最小限に抑える。
  • リソース利用状況とフェーズ要件に基づき、動的にリクエストを適切なハードウェアプールに割り当てる混合プールスケジューリング戦略を採用する。
  • 既存のGPUクラスタ用インターコネクト(例:Infiniband、RoCE)を活用し、ブロックサイズを小さくすることでデータ転送を最適化し、クリティカルパスの遅延を最小化する。
  • 異種ハードウェアをサポート:プロンプトフェーズには高計算能力GPU(例:H100)、トークンフェーズには高メモリ帯域幅デバイス(例:A100、MI-250、またはHBM搭載CPU)を活用する。
  • スループット、コスト、電力の最適化を図ったクラスタ構成を、厳密なサービスレベルオブジェクティブ(SLO)の下で、実世界のLLM推論トレースを用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1LLM推論におけるプロンプト計算とトークン生成フェーズを分離することで、システム全体のスループット、コスト効率、電力効率を向上させられるか?
  • RQ2物理的に分離されたマシン間で、KVキャッシュの低遅延かつ高帯域幅の状態転送を実現する方法は何か? ただし、エンドツーエンドの遅延が悪化しないようにする。
  • RQ3計算とメモリ特性が異なる各フェーズに最適なハードウェア構成は何か?
  • RQ4フェーズ分離が、さまざまなワークロード、モデルサイズ、入力トークン分布の下でパフォーマンスに与える影響は何か?
  • RQ5フェーズ分離により、高価なGPUの過剰プロビジョニングをどの程度削減できるか? ただし、厳密な推論SLOを満たすものとする。

主な発見

  • 同じハードウェアを用いた場合、Splitwiseはベースライン設計と比較して1.4倍の高いスループットを達成し、コストは20%低減する。
  • 同一のコストと電力予算下でも、Splitwiseは現在の推論クラスターよりも2.35倍の高いスループットを実現する。
  • 高帯域幅インターコネクトを介した小規模で効率的なデータブロックを用いたKVキャッシュ転送の最適化により、エンドツーエンドの遅延を低く保つ。
  • H100をプロンプトフェーズ、A100をトークンフェーズに使用する最適化されたクラスタでは、コストは同じでスループットが1.76倍に向上し、電力は15%低減される。
  • さまざまなワークロードに強く、CPUやAMD MI-250 GPUを含む異種ハードウェアをトークン生成フェーズに活用できる。
  • 高負荷時、混合バッチ処理の影響でSplitwiseクラスタはベースラインの挙動に近づくが、依然としてパフォーマンス/ドルおよびパフォーマンス/ワットの指標でベースラインを上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。