Skip to main content
QUICK REVIEW

[論文レビュー] PRETZEL: Opening the Black Box of Machine Learning Prediction Serving Systems

Yunseong Lee, Alberto Scolari|arXiv (Cornell University)|Oct 14, 2018
Parallel Computing and Optimization Techniques参考文献 37被引用数 9
ひとこと要約

Pretzelは、モデルパイプラインの内部構造を公開することで、エンドツーエンドおよびマルチパイプライン実行の最適化を可能にするホワイトボックス機械学習予測サービングシステムを導入する。これにより、共有パラメータ、物理的オペレータの再利用、インテリジェントなスケジューリングが実現される。Pretzelは、最先端のブラックボックスシステムと比較して、メモリ使用量を25倍低減し、99パーセンタイル遅延を5.5倍低減し、スループットを4.7倍向上する。

ABSTRACT

Machine Learning models are often composed of pipelines of transformations. While this design allows to efficiently execute single model components at training time, prediction serving has different requirements such as low latency, high throughput and graceful performance degradation under heavy load. Current prediction serving systems consider models as black boxes, whereby prediction-time-specific optimizations are ignored in favor of ease of deployment. In this paper, we present PRETZEL, a prediction serving system introducing a novel white box architecture enabling both end-to-end and multi-model optimizations. Using production-like model pipelines, our experiments show that PRETZEL is able to introduce performance improvements over different dimensions; compared to state-of-the-art approaches PRETZEL is on average able to reduce 99th percentile latency by 5.5x while reducing memory footprint by 25x, and increasing throughput by 4.7x.

研究の動機と目的

  • デプロイの簡便さを重視するあまり、予測時最適化を無視するブラックボックスMLサービングシステムの限界を是正すること。
  • エンドツーエンドおよびマルチパイプライン最適化を可能にすることで、ML推論におけるメモリ使用量と遅延を低減すること。
  • 類似したパイプライン間でのパラメータおよび物理的オペレータの共有を通じて、リソース利用効率とスループットを向上させること。
  • 推論リクエストを共有CPUおよびメモリリソースに効率的にバインドするスケジューリングシステムを設計すること。
  • 実世界のデプロイ環境における生産向けMLパイプラインに対して、高性能で低遅延の推論を実現すること。

提案手法

  • Pretzelは2段階アーキテクチャを採用する:オフライン段階で統計情報の収集とモデル計画のコンパイルを行い、オンライン段階でリクエスト実行を行う。
  • 訓練済みパイプラインをホワイトボックスモデル計画にコンパイルし、最適化のための論理的および物理的オペレータ構造を公開する。
  • トレーニング時の統計情報とメモリ内データシステムの原則を活用して、エンドツーエンド最適化を実施し、リソース使用量を最小限に抑える。
  • マルチパイプライン最適化により、類似したパイプライン間でパラメータ(例:重み、辞書)および物理的オペレータを共有できる。
  • イベントベースの新規スケジューラーが、推論リクエストを共有CPU実行ユニットにバインドし、並列実行と負荷に応じたリソースプール化を可能にする。
  • データベーススタイルのクエリ最適化技術、特に論理的および物理的計画の再書き換えを活用して、パフォーマンスを向上させる。

実験結果

リサーチクエスチョン

  • RQ1予測時最適化を無視してもデプロイの簡便さを損なわずに、ML予測サービングシステムが遅延とメモリ使用量をどのように低減できるか。
  • RQ2パイプライン間で共有されるパラメータおよび物理的オペレータが、推論ワークロードにおけるリソース利用効率にどの程度寄与するか。
  • RQ3エンドツーエンドおよびマルチパイプライン最適化が、実世界の生産環境シナリオにおいてブラックボックスサービングシステムを上回るか。
  • RQ4ホワイトボックスアーキテクチャは、ブラックボックスコンテナベースのアプローチと比較して、ML推論におけるスケジューリングと並列処理にどのように優位性を発揮するか。
  • RQ5共有リソース環境下でのMLパイプラインのコンパイラレベル最適化により、どの程度のパフォーマンス向上が達成可能か。

主な発見

  • Pretzelは、Clipper や TensorFlow Serving などの最先端ブラックボックスシステムと比較して、99パーセンタイル遅延を5.5倍低減した。
  • 類似したパイプライン間でのパラメータおよび物理的オペレータの共有により、25倍のメモリ使用量削減を達成した。
  • 効率的なリソースプール化と並列リクエストスケジューリングのおかげで、スループットが4.7倍向上した。
  • 500の生産向けパイプラインを対象にした評価において、ML.Net や Clipper と比較して、すべての主要指標で優れた性能を示した。
  • ホワイトボックスアーキテクチャにより、パイプライン内部構造を公開することで、共同最適化が可能となり、顕著なパフォーマンス向上が達成された。
  • 共通コンponentを共有するモデルのコロケーションにより、テール遅延が低減し、スワップによるメモリ圧迫も回避された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。