Skip to main content
QUICK REVIEW

[논문 리뷰] Ease.ml: Towards Multi-tenant Resource Sharing for Machine Learning Workloads

Tian Li, Jie Zhong|arXiv (Cornell University)|2017. 08. 24.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 17
한 줄 요약

이 논문은 ETH 취리히 소속 비CS 연구자들이 공유하는 중앙집중식 GPU 및 스토리지 클러스터를 활용할 수 있도록 하는 선언적 머신러닝 서비스 플랫폼 ease.ml을 소개한다. 다중 테넌트 환경에서 자원 공유를 가능하게 하며, 이는 다중 암호화된 밴드위트와 베이지안 최적화를 융합한 새로운 비용 인식형 다중 테넌트 모델 선택 알고리즘을 제안한다. 이 알고리즘은 이론적 리그레트 한계를 제공하며, 실제 이미지 분류 워크로드에서 히우리스틱 방법 대비 최대 9.8배 빠른 수렴 속도를 달성한다.

ABSTRACT

We present ease.ml, a declarative machine learning service platform we built to support more than ten research groups outside the computer science departments at ETH Zurich for their machine learning needs. With ease.ml, a user defines the high-level schema of a machine learning application and submits the task via a Web interface. The system automatically deals with the rest, such as model selection and data movement. In this paper, we describe the ease.ml architecture and focus on a novel technical problem introduced by ease.ml regarding resource allocation. We ask, as a "service provider" that manages a shared cluster of machines among all our users running machine learning workloads, what is the resource allocation strategy that maximizes the global satisfaction of all our users? Resource allocation is a critical yet subtle issue in this multi-tenant scenario, as we have to balance between efficiency and fairness. We first formalize the problem that we call multi-tenant model selection, aiming for minimizing the total regret of all users running automatic model selection tasks. We then develop a novel algorithm that combines multi-armed bandits with Bayesian optimization and prove a regret bound under the multi-tenant setting. Finally, we report our evaluation of ease.ml on synthetic data and on one service we are providing to our users, namely, image classification with deep neural networks. Our experimental evaluation results show that our proposed solution can be up to 9.8x faster in achieving the same global quality for all users as the two popular heuristics used by our users before ease.ml.

연구 동기 및 목표

  • 여러 비CS 연구자가 중앙집중식 GPU 및 스토리지 클러스터를 공유하는 다중 테넌트 머신러닝 환경에서 효율적이고 공정한 자원 할당 문제를 해결한다.
  • 모든 사용자 간의 총 리그레트 최소화를 목표로 다중 테넌트 모델 선택 문제를 수식화하여, 공유 인프라에서 효율성과 공정성을 균형 잡는다.
  • 이질적인 모델 비용과 성능 조건 하에서 자원 할당을 최적화하기 위해 다중 암호화된 밴드위트와 베이지안 최적화를 융합한 새로운 알고리즘을 설계한다.
  • 다중 테넌트 비용 인식 설정 하에서 제안된 알고리즘의 이론적 리그레트 한계를 제공하여 모든 사용자에게 전역적 만족도를 보장한다.
  • 합성 데이터와 실제 이미지 분류 작업을 대상으로 시스템을 평가하여 기존 히우리스틱 기반 접근 방식에 비해 열등한 성능을 보여준다.

제안 방법

  • 다중 테넌트 모델 선택 문제를 모든 사용자 간의 전역 리그레트 최소화 목표로 수식화하여, 모델 성능과 실행 비용을 모두 고려한다.
  • GP-UCB(Gaussian Process Upper Confidence Bound) 프레임워크에 비용 인식 기능을 통합하여 고가치·저비용 모델 평가를 우선시한다.
  • 다중 작업 가우시안 프로세스 추정기를 사용하여 사용자 간 성능을 모델링하며, 각 사용자의 모델 탐색을 별개이지만 상관관계가 있는 작업으로 간주한다.
  • 다양한 사용자 간에 동시에 여러 모델을 평가할 수 있는 하이브리드 실행 전략을 설계하여 탐색 효율성을 향상시킨다.
  • 탐색(더 나은 모델을 찾기 위한 탐색)과 이용(높은 성능을 보이는 모델을 우선시하는 것)을 균형 잡는 동적 자원 할당 정책을 구현한다.
  • 이론적 분석을 통해 다중 테넌트 비용 인식 설정 하에서 리그레트 한계를 도출하여 제안된 알고리즘의 수렴 보장을 입증한다.

실험 결과

연구 질문

  • RQ1다양한 워크로드를 가진 여러 사용자 간에 공정성과 효율성을 균형 잡는 전역 최적화 목표를 어떻게 정의할 수 있는가?
  • RQ2모델 실행 비용을 다중 테넌트 모델 선택 과정에 통합할 경우, 이는 수렴 속도와 품질에 어떤 영향을 미치는가?
  • RQ3다중 암호화된 밴드위트와 베이지안 최적화를 융합한 하이브리드 접근 방식이 실제 머신러닝 워크로드에서 히우리스틱 기반 자원 할당보다 뛰어난 성능을 보일 수 있는가?
  • RQ4다양한 데이터 크기와 모델 복잡도를 가진 여러 사용자들이 공유 GPU 환경에서 제안된 알고리즘이 어떻게 확장 가능한가?
  • RQ5다중 테넌트 비용 인식 설정 하에서 제안된 알고리즘의 이론적 보장(예: 리그레트 한계)은 무엇인가?

주요 결과

  • 제안된 다중 테넌트 모델 선택 알고리즘은 실제에서 널리 사용되는 두 가지 히우리스틱 방법 대비 동일한 전역 모델 품질에 도달하는 데 최대 9.8배 더 빠른 수렴 속도를 달성한다.
  • 시스템은 모델 실행 비용을 고려하면서도 탐색과 이용의 균형을 지능적으로 유지함으로써 모든 사용자 간 총 리그레트를 크게 감소시킨다.
  • GP-UCB 프레임워크에 비용 인식 기능을 통합함으로써 자원 활용 효율성이 향상되어 고비용·저성과 모델의 낭비적 평가를 방지한다.
  • 실제 이미지 분류 워크로드에서의 평가 결과, ease.ml은 높은 사용자 동시성 조건 하에서도 히우리스틱 방법에 비해 속도와 모델 품질 측면에서 뛰어난 성능을 보였다.
  • 제안된 알고리즘은 다중 테넌트 비용 인식 설정 하에서 이론적 리그레트 한계가 확립되어 있으며, 수렴에 대한 공식적 보장을 제공한다.
  • 이 시스템은 ETH 취리히 소속 다양한 머신러닝 워크로드를 가진 10개 이상의 다학제 연구 그룹을 지원하는 생산 환경에서 실용적 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.