Skip to main content
QUICK REVIEW

[논문 리뷰] AutoML from Service Provider's Perspective: Multi-device, Multi-tenant Model Selection with GP-EI

Chen Yu, Bojan Karlaš|arXiv (Cornell University)|2018. 03. 17.
Machine Learning and Data Classification인용 수 4
한 줄 요약

이 논문은 자동화된 머신러닝(AutoML) 서비스 제공자를 위해 다수의 사용자가 공유하는 제한된 계산 장치를 지능적으로 할당하여 글로벌 사용자 만족도를 최적화하는 다기기, 다테넌트 GP-EI 알고리즘을 제안한다. 랜덤 또는 윤활식 스케줄링과 비교해 거의 선형적 성능 향상과 상당한 감소된 회귀(regret)를 달성하며, 이론적 회귀 한계는 $O((\text{MIU}(T,K)+M)\frac{N^2}{M})$이다.

ABSTRACT

AutoML has become a popular service that is provided by most leading cloud service providers today. In this paper, we focus on the AutoML problem from the \emph{service provider's perspective}, motivated by the following practical consideration: When an AutoML service needs to serve {\em multiple users} with {\em multiple devices} at the same time, how can we allocate these devices to users in an efficient way? We focus on GP-EI, one of the most popular algorithms for automatic model selection and hyperparameter tuning, used by systems such as Google Vizer. The technical contribution of this paper is the first multi-device, multi-tenant algorithm for GP-EI that is aware of \emph{multiple} computation devices and multiple users sharing the same set of computation devices. Theoretically, given $N$ users and $M$ devices, we obtain a regret bound of $O(( ext{\bf {MIU}}(T,K) + M)\frac{N^2}{M})$, where $ ext{\bf {MIU}}(T,K)$ refers to the maximal incremental uncertainty up to time $T$ for the covariance matrix $K$. Empirically, we evaluate our algorithm on two applications of automatic model selection, and show that our algorithm significantly outperforms the strategy of serving users independently. Moreover, when multiple computation devices are available, we achieve near-linear speedup when the number of users is much larger than the number of devices.

연구 동기 및 목표

  • 여러 사용자가 제한된 수의 계산 장치를 공유하는 AutoML 서비스 환경에서 자원 할당의 효율성을 높이는 문제를 해결한다.
  • 모든 사용자의 누적 회귀를 최소화함으로써 전반적인 '기쁨'을 극대화하는 비용 민감하고 확장 가능한 알고리즘을 개발한다.
  • 공유 자원 할당 환경에서 다기기, 다테넌트 GP-EI의 이론적 회귀 한계를 제공한다.
  • 실세계 AutoML 워크로드에서 랜덤 또는 윤활식 할당과 같은 단순 스케줄링 전략을 향상시킨다.
  • 특히 사용자 수가 장치 수를 초과할 경우, 복수의 장치가 가용할 때 수렴 시간에 거의 선형적 성능 향상을 달성할 수 있도록 한다.

제안 방법

  • 제안된 MM-GP-EI 알고리즘은 사용자 간 가우시안 프로세스 사전분포 간의 의존성을 모델링하기 위해 최대 증분 불확실성(MIU)을 사용하며, 기대 개선도를 기반으로 사용자를 우선순위 순으로 정렬한다.
  • 각 사용자는 자체 GP-EI 인스턴스를 유지하며 초모수에 대한 공유 사전분포를 공유하고, 시스템은 MIU와 장치 가용성 요소를 고려한 가중치가 부여된 획득 함수를 기반으로 다음으로 서비스할 사용자를 선택한다.
  • 탐색과 이용의 균형을 맞추기 위해 상한 신뢰도 기반 획득 함수를 사용하며, 불확실성과 기대 수익에 따라 동적으로 재가중된다.
  • 알고리즘은 시간 단위 당 기대 개선도가 가장 높은 사용자에게 장치를 동적으로 할당함으로써 제한된 하드웨어 자원을 효율적으로 활용한다.
  • 효율적인 구현은 공유 공분산 행렬과 MIU에 대한 점진적 업데이트를 사용하여 스케줄링 결정 시 계산 오버헤드를 줄인다.
  • 특히 초기 단계에서 불확실성이 높을 때 성능 향상 잠재력이 가장 큰 사용자를 우선순위로 삼음으로써 회귀를 최소화한다.

실험 결과

연구 질문

  • RQ1공유 AutoML 환경에서 다기기, 다테넌트 GP-EI 알고리즘을 설계하여 글로벌 사용자 만족도를 최적화할 수 있는 방법은 무엇인가?
  • RQ2공유 장치 제약 조건 하에서 이러한 알고리즘의 이론적 회귀 한계는 무엇인가?
  • RQ3제안된 알고리즘이 수렴 속도와 회귀 감소 측면에서 랜덤 및 윤활식 스케줄링과 비교해 어떻게 성능을 냈는가?
  • RQ4장치 수를 늘릴 경우 알고리즘이 거의 선형적 성능 향상을 달성하는가?
  • RQ5기본 전략 대비 가장 뚜렷한 성능 향상을 보이는 조건는 무엇인가?

주요 결과

  • Azure 데이터셋에서 다테넌트 GP-EI는 랜덤 및 윤활식 스케줄링 대비 최대 5배 빠른 수렴 속도로 동일한 수준의순간적 회귀(regret)에 도달한다.
  • Azure 데이터셋에서 제안된 방법은 윤활식 스케줄링 대비 목표 순간적 회귀 수준에 도달하는 데 5배 빠른 성능 향상을 보였다.
  • 사용자 수가 장치 수를 초과할 경우 성능 향상이 가장 두드러졌으며, 장치 수가 증가함에 따라 거의 선형적인 수렴 향상이 관찰되었다.
  • 50명의 사용자와 50개의 모델을 가진 합성 데이터셋에서의 실험 결과, 장치 수가 증가함에 따라 수렴 시간이 거의 선형적으로 감소하였다.
  • 이론적 회귀 한계 $O((\text{MIU}(T,K)+M)\frac{N^2}{M})$는 최적 속도로 수렴하며, 관찰된 성능 향상 행동을 뒷받침한다.
  • DeepLearning 데이터셋에서는 초반 시험 후 정확도 분산이 낮아(0.04 vs. Azure의 0.12) 향상 여유가 적어 성능 향상 폭이 더 작았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.