[論文レビュー] InferLine: ML Prediction Pipeline Provisioning and Management for Tight Latency Objectives
InferLine は、最小コストで厳密なエンドツーエンドの尾遅延 SLO を満たすために、複数段階の機械学習推論パイプラインのプロビジョニングおよび管理を自動化するシステムである。低周波の組み合わせ最適化計画者(プロファイリングおよび離散イベントシミュレーションを用いる)と、ネットワーク計算に基づく高周波の自己スケーリングチューナーを組み合わせ、ワークロードの変化に応じてパイプライン構成を動的に調整する。これにより、従来の手法と比較してコストを最大 7.6 倍低減し、SLO 違反率を 34.5 倍低減する。
Serving ML prediction pipelines spanning multiple models and hardware accelerators is a key challenge in production machine learning. Optimally configuring these pipelines to meet tight end-to-end latency goals is complicated by the interaction between model batch size, the choice of hardware accelerator, and variation in the query arrival process. In this paper we introduce InferLine, a system which provisions and manages the individual stages of prediction pipelines to meet end-to-end tail latency constraints while minimizing cost. InferLine consists of a low-frequency combinatorial planner and a high-frequency auto-scaling tuner. The low-frequency planner leverages stage-wise profiling, discrete event simulation, and constrained combinatorial search to automatically select hardware type, replication, and batching parameters for each stage in the pipeline. The high-frequency tuner uses network calculus to auto-scale each stage to meet tail latency goals in response to changes in the query arrival process. We demonstrate that InferLine outperforms existing approaches by up to 7.6x in cost while achieving up to 34.5x lower latency SLO miss rate on realistic workloads and generalizes across state-of-the-art model serving frameworks.
研究の動機と目的
- 厳しいエンドツーエンドの尾遅延制約の下で、複雑なマルチモデル ML 推論パイプラインの構成と管理の課題に対処すること。
- アプリケーション指定のサービスレベルオブジェクティブ(SLO)内でエンドツーエンド遅延を維持しつつ、運用コストを最小限に抑えること。
- パイプライン段階全体におけるハードウェアアクセラレータ、バッチサイズ、レプリケーションレベルの自動選択を実現し、手動チューニングの負担を軽減すること。
- リクエストを拒否せずに、バースト的かつ変動するクエリワークロードに動的に適応し、リアルタイムのトラフィック変化に対しても SLO を遵守すること。
- TensorFlow Serving や Clipper といった最新のモデルサービングフレームワークに一般化可能であり、広範な展開を可能にすること。
提案手法
- 低周波のプランナーは、段階ごとのプロファイリングと離散イベントシミュレーションを用いて、さまざまな構成におけるエンドツーエンドパイプライン遅延をモデル化する。
- エンドツーエンドの尾遅延 SLO を満たすコスト最小化構成を特定するため、制約付きの組み合わせ最適化を実行する。
- 高周波のチューナーは、複数の時間スケールにおけるトラフィックエンvelope をネットワーク計算でモデル化し、ワークロードのシフトを検出する。
- クエリ到着パターンの変化に応じて、個々のパイプライン段階を動的に自己スケーリングし、リクエスト拒否を伴わずに SLO を遵守する。
- 推論エンジンを置き換えるのではなく、既存のサービングフレームワークと統合するため、構成およびオ케ストレーションレイヤーとして機能する。
- ML 推論の決定論的かつ副作用のない性質を活用し、個々のモデルプロファイルからパイプラインのパフォーマンスを推定する。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドの尾遅延 SLO を満たしつつコストを最小限に抑えるために、複数段階の ML 推論パイプラインを自動的に構成する方法は何か?
- RQ2変動するワークロード下で、各段階における最適なハードウェアアクセラレータ、バッチサイズ、レプリケーションの組み合わせは何か?
- RQ3一時的なクエリピークに対応するために、リアルタイムでパイプライン構成を動的に適応させる方法は何か?
- RQ4シミュレーションとネットワーク計算を用いたプランナー・チューナー・アーキテクチャは、従来の静的または粗い粒度の自己スケーリング手法に比べ、コストと SLO 遵守の両面で優れているか?
- RQ5本システムは、多様なモデルタイプ、入力特性、およびサービングフレームワークに一般化できるか?
主な発見
- InferLine は、ベースラインの構成戦略と比較して、コストを最大 7.6 倍低減しながらも、SLO 遵守を維持または向上させた。
- 本システムは、実際のワークロードにおいて、既存の手法と比較して SLO 違反率が 34.5 倍低減した。
- InferLine は 99% を超える SLO 遵守率を達成し、このようなシステムにおいて報告された最高水準の数値である。
- 高周波のチューナーは、粗い粒度の自己スケーリングベースラインと比較して、遅延 SLO 違反率とコスト効率の両面で優れた性能を示した。
- プランナーのシミュレーションベースのアプローチは、実際のパイプラインをデプロイせずにエンドツーエンド遅延を正確に予測できた。
- 本システムは、画像処理、動画監視、ソーシャルメディア、TF Cascade を含む多様なパイプラインに一般化可能であり、広範な適用性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。