Skip to main content
QUICK REVIEW

[論文レビュー] Ease.ml: Towards Multi-tenant Resource Sharing for Machine Learning Workloads

Tian Li, Jie Zhong|arXiv (Cornell University)|Aug 24, 2017
Advanced Bandit Algorithms Research参考文献 21被引用数 17
ひとこと要約

本稿では、ETHチューリッヒの非CS分野の研究者らが共同で使用する集中型GPUおよびストレージクラスタを対象に、マルチテントのリソース共有を可能にする宣言的機械学習サービスプラットフォーム、ease.mlを紹介する。本稿では、マルチアームドバンディットとベイズ最適化を組み合わせた、コストを考慮した新しいマルチテントモデル選択アルゴリズムを提案し、理論的レグレットバウンドを備え、実世界の画像分類ワークロードにおいてヒューリスティック手法と比較して最大9.8倍速い収束を達成する。

ABSTRACT

We present ease.ml, a declarative machine learning service platform we built to support more than ten research groups outside the computer science departments at ETH Zurich for their machine learning needs. With ease.ml, a user defines the high-level schema of a machine learning application and submits the task via a Web interface. The system automatically deals with the rest, such as model selection and data movement. In this paper, we describe the ease.ml architecture and focus on a novel technical problem introduced by ease.ml regarding resource allocation. We ask, as a "service provider" that manages a shared cluster of machines among all our users running machine learning workloads, what is the resource allocation strategy that maximizes the global satisfaction of all our users? Resource allocation is a critical yet subtle issue in this multi-tenant scenario, as we have to balance between efficiency and fairness. We first formalize the problem that we call multi-tenant model selection, aiming for minimizing the total regret of all users running automatic model selection tasks. We then develop a novel algorithm that combines multi-armed bandits with Bayesian optimization and prove a regret bound under the multi-tenant setting. Finally, we report our evaluation of ease.ml on synthetic data and on one service we are providing to our users, namely, image classification with deep neural networks. Our experimental evaluation results show that our proposed solution can be up to 9.8x faster in achieving the same global quality for all users as the two popular heuristics used by our users before ease.ml.

研究の動機と目的

  • 複数の非CS分野の研究者が集中型GPUおよびストレージクラスタを共有するマルチテント機械学習環境において、効率的かつ公平なリソース割り当てを実現する課題に対処する。
  • すべてのユーザーの合計レグレットを最小化するという問題としてマルチテントモデル選択を形式化し、共有インフラにおける効率性と公平性のバランスを取る。
  • 異種のモデルコストとパフォーマンスを考慮したリソース割り当てを最適化するため、マルチアームドバンディットとベイズ最適化を統合した新しいアルゴリズムを設計する。
  • マルチテントでコストを考慮した設定下で、提案されたアルゴリズムの理論的レグレットバウンドを提供し、すべてのユーザーに対してグローバルな満足度を保証する。
  • 合成データおよび実世界の画像分類タスク上でシステムを評価し、従来のヒューリスティックベースの手法と比較して優れた性能を示す。

提案手法

  • すべてのユーザーにわたるグローバルなレグレット最小化を最適化目標として、マルチテントモデル選択問題を形式化し、モデルパフォーマンスと実行コストの両方を考慮する。
  • GP-UCB(ガウス過程上昇信頼区間)フレームワークにコストを考慮した要素を統合し、高価値・低コストのモデル評価を優先する。
  • マルチタスクガウス過程推定器を用いてユーザー間でのパフォーマンスをモデル化し、各ユーザーのモデル探索を個別だが相関のあるタスクとして扱う。
  • 複数のモデルを同時に複数ユーザー間で評価できるハイブリッド実行戦略を設計し、探索の効率を向上させる。
  • 探索(より良いモデルの探索)と活用(高いパフォーマンスを示すモデルの優遇)の両方をバランスさせる動的リソース割り当てポリシーを実装する。
  • 理論的分析により、マルチテントでコストを考慮した設定下でのレグレットバウンドを導出しており、提案されたアルゴリズムの収束保証を裏付ける。

実験結果

リサーチクエスチョン

  • RQ1異種のワークロードを持つ複数ユーザー間で、公平性と効率性を両立させるグローバル最適化目標として、マルチテントモデル選択をどのように定式化できるか?
  • RQ2モデル実行コストをマルチテントモデル選択プロセスに組み込むと、収束速度および品質にどのような影響を与えるか?
  • RQ3マルチアームドバンディットとベイズ最適化をハイブリッド化したアプローチは、実世界のMLワークロードにおいてヒューリスティックベースのリソース割り当てを上回る性能を発揮できるか?
  • RQ4複数ユーザーが異なるデータサイズおよびモデル複雑度を持つ環境下で、共有GPU環境における提案アルゴリズムのスケーラビリティはどの程度か?
  • RQ5マルチテントでコストを考慮した設定下で、提案アルゴリズムの理論的保証(例:レグレットバウンド)は何か?

主な発見

  • 提案されたマルチテントモデル選択アルゴリズムは、実際で広く使われている2つのヒューリスティック手法と比較して、同じグローバルモデル品質に到達するまでの収束が最大9.8倍速い。
  • システムは、モデル実行コストを尊重しながら探索と活用のバランスを知的にとることで、すべてのユーザーの合計レグレットを顕著に低減する。
  • GP-UCBフレームワークへのコストを考慮した統合により、高コストで利益が小さいモデルの無駄な評価を回避し、リソースの効率的利用が実現される。
  • 実世界の画像分類ワークロードにおける評価では、ease.mlはヒューリスティック手法と比較して、速度およびモデル品質の両面で優れた性能を示す。これは、高ユーザーコンcurrency下でも同様に成立する。
  • 提案されたアルゴリズムの理論的レグレットバウンドは、マルチテントでコストを考慮した設定下で確立されており、収束の形式的保証を提供する。
  • 本システムは、多様なMLワークロードを有する10以上の学際的研究グループを対象に、生産環境で実用的であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。