[論文レビュー] Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction
本論文では、出力シーケンス長を予測するために軽量なプロキシモデルを用いることで、より良いリクエストスケジューリングを可能にする、効率的なインタラクティブなLLMサービングのための予測型最短作業優先(SSJF)スケジューラを提案する。本手法は、実世界のデータセットおよび本番トレース上で評価され、バッチ処理のメカニズムやメモリ管理を変更せずに、ノーバッチ、ダイナミックバッチ、継続的バッチの各設定において、平均ジョブ完了時間を30.5–39.6%短縮し、スループットを2.2–3.6倍向上した。
Large language models (LLMs) have been driving a new wave of interactive AI applications across numerous domains. However, efficiently serving LLM inference requests is challenging due to their unpredictable execution times originating from the autoregressive nature of generative models. Existing LLM serving systems exploit first-come-first-serve (FCFS) scheduling, suffering from head-of-line blocking issues. To address the non-deterministic nature of LLMs and enable efficient interactive LLM serving, we present a speculative shortest-job-first (SSJF) scheduler that uses a light proxy model to predict LLM output sequence lengths. Our open-source SSJF implementation does not require changes to memory management or batching strategies. Evaluations on real-world datasets and production workload traces show that SSJF reduces average job completion times by 30.5-39.6% and increases throughput by 2.2-3.6x compared to FCFS schedulers, across no batching, dynamic batching, and continuous batching settings.
研究の動機と目的
- 自己回帰的LLM推論における変動する出力シーケンス長に起因する非決定的実行時間の問題を解決すること。
- 先着順(FCFS)スケジューリングに依存するLLMサービングシステムにおけるヘッド・オブ・ラインブロッキングを軽減すること。
- メモリ管理やバッチ処理戦略を変更せずに、インタラクティブなLLMアプリケーションにおけるジョブ完了時間とシステムスループットを向上させること。
- ノーバッチ、ダイナミックバッチ、継続的バッチの多様なバッチ処理設定における効率的スケジューリングを可能にすること。
- 実世界のLLMサービングワークロードにおいて、軽量なプロキシモデルを用いたシーケンス長予測の実現可能性と性能向上を示すこと。
提案手法
- 入力クエリに基づいてLLM推論リクエストの出力シーケンス長を予測する、小型でファインチューニングされたBERT-baseプロキシモデルを訓練する。
- 予測されたシーケンス長を用いて合計実行時間を推定し、予測型最短作業優先(SSJF)スケジューリングを実現する。
- SSJFスケジューラは、予測実行時間が短いリクエストを優先することで、ヘッド・オブ・ラインブロッキングを低減する。
- プロキシモデルは本番のLLM推論パイプラインとは独立して適用され、メモリ管理やキーバリューキャッシュ管理に変更を加える必要がない。
- 本システムは、ノーバッチ、ダイナミックバッチ、および継続的(イテレーション)バッチの複数のバッチ戦略をサポートする。
- 予測精度を向上させるために、プロキシモデルは実世界のLLM会話データ(例:LMSYS-Chat-1M)上で再訓練される。

実験結果
リサーチクエスチョン
- RQ1軽量なプロキシモデルは、LLM推論リクエストの出力シーケンス長を正確に予測できるか?
- RQ2予測されたシーケンス長を用いた予測型最短作業優先(SSJF)スケジューリングにより、LLMサービングにおける平均ジョブ完了時間が短縮されるか?
- RQ3ノーバッチ、ダイナミックバッチ、継続的バッチを含む、さまざまなバッチ戦略においてSSJFはどのように性能を発揮するか?
- RQ4既存のLLMサービングシステムにおけるメモリ管理やバッチ論理を変更せずに、SSJFはシステムスループットを向上させられるか?
- RQ5自己プロンプティングや小規模データセットにおける回帰分析と比較して、プロキシモデルベースの予測手法はどの程度の性能向上を達成できるか?
主な発見
- SSJFは、全評価バッチ設定においてFCFSスケジューリングと比較して、平均ジョブ完了時を30.5–39.6%短縮した。
- SSJFを用いることで、リクエストレートやバースト性の変動にかかわらず、スループットが2.2–3.6倍向上した。
- プロキシモデルは実世界のLLM会話データにおいて高い予測精度を達成し、回帰ベースの予測が多クラス分類を上回った。
- 本手法は、メモリ管理やキャッシュ管理を変更せずに、ノーバッチ、ダイナミックバッチ、継続的バッチを含む多様なバッチ戦略において効果的である。
- 自己プロンプティングによるLLMを用いた予測手法に比べ、バイアスを回避し、オーバーヘッドを低減する点で、プロキシモデルベースのアプローチが優れている。
- オープンソースのSSJF実装は、実本番ワークロードトレースおよび人気のオープンソースLLMにおいて、一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。