Skip to main content
QUICK REVIEW

[논문 리뷰] PerfEnforce: A Dynamic Scaling Engine for Analytics with Performance Guarantees

Jennifer Ortiz, Brendan Lee|arXiv (Cornell University)|2016. 05. 31.
Cloud Computing and Resource Management참고 문헌 23인용 수 5
한 줄 요약

PerfEnforce는 쿠버네티스 기반 가상 머신 클러스터를 실시간으로 동적으로 스케일링하여 클라우드 기반 데이터 분석 서비스에서 성능 SLA를 보장하는 동적 스케일링 엔진입니다. 비용을 최소화하면서도 쿼리 실행 시간이 SLA 목표를 충족하도록 보장하며, 퍼셉트론 학습을 활용해 쿼리 간에 클러스터 크기를 적응적으로 조정합니다. 이는 피드백 제어 및 강화 학습보다 낮은 지연과 비용, 최소한의 교란을 유지하는 데서 뛰어난 성능을 발휘합니다.

ABSTRACT

In this paper, we present PerfEnforce, a scaling engine designed to enable cloud providers to sell performance levels for data analytics cloud services. PerfEnforce scales a cluster of virtual machines allocated to a user in a way that minimizes cost while probabilistically meeting the query runtime guarantees offered by a service level agreement. With PerfEnforce, we show how to scale a cluster in a way that minimally disrupts a user's query session. We further show when to scale the cluster using one of three methods: feedback control, reinforcement learning, or perceptron learning. We find that perceptron learning outperforms the other two methods when making cluster scaling decisions.

연구 동기 및 목표

  • 사용자가 고정된 자원 할당 대신 지연 SLA를 구매하는 클라우드 기반 데이터 분석 서비스에서 성능 보장을 제공하는 데 도전 과제를 해결하기 위해.
  • 운영 비용을 최소화하면서도 사용자 쿼리가 SLA에서 정의한 실행 시간 목표를 충족하도록 보장하기 위해.
  • 부분적 데이터 복제를 통한 로컬, 공유 자원이 없는 스토리지 아키텍처를 활용해 클러스터 재구성 시 교란을 최소화하기 위해.
  • 실시간으로 변화하는 쿼리 워크로드에 적응하는 동적 스케일링 전략을 개발하고 평가하기 위해.
  • 클라우드 제공자가 경험적 성능 분포를 바탕으로 확률적 SLA를 제공할 수 있도록 하기 위해.

제안 방법

  • PerfEnforce는 사용자에 할당된 가상 머신(VMS) 클러스터의 크기를 성능 SLA 요구사항에 따라 동적으로 재조정합니다.
  • 빠른 클러스터 재구성과 설정 시간 단축을 위해 부분적 데이터 복제를 지원하는 공유 자원이 없는 스토리지 아키텍처를 사용합니다.
  • 시스템은 피드백 제어, 강화 학습(RL), 퍼셉트론 학습(PL)의 세 가지 스케일링 의사결정 전략을 평가합니다.
  • 퍼셉트론 학습은 최근 쿼리 성능을 기반으로 쿼리 시간 추정치를 지속적으로 업데이트하여 워크로드 변화에 신속히 적응합니다.
  • 스케일링 결정은 이전 SLA 준수 기반의 사전 조치 또는 각 쿼리 실행 전의 반응적 조치 방식으로 이루어집니다.
  • 스케일링 전략을 오라클 기반 기준과 비교하기 위해 성능 비율(PR)과 서비스 비용(CS) 메트릭을 계산합니다.

실험 결과

연구 질문

  • RQ1클라우드 분석 시스템은 어떻게 동적으로 VM 클러스터를 스케일링하여 성능 SLA 보장을 확보하면서 비용을 최소화할 수 있는가?
  • RQ2피드백 제어, 강화 학습, 퍼셉트론 학습의 다양한 동적 스케일링 전략 간의 성능 준수율과 비용 간의 상호 교환 관계는 어떠한가?
  • RQ3퍼셉트론 기반 학습 모델은 변동성이 큰 쿼리 워크로드에 적응하는 데 있어 전통적인 제어 및 강화 학습 방법을 능가할 수 있는가?
  • RQ4부분적 데이터 복제 및 로컬 스토리지 구조는 클러스터 재구성 오버헤드와 쿼리 실행 안정성에 어떤 영향을 미치는가?
  • RQ5경험적 성능 분포를 바탕으로 신뢰성 있게 광고할 수 있는 확률적 SLA 파라미터는 무엇인가?

주요 결과

  • 퍼셉트론 학습(PL)은 오라클과 가장 유사한 성능 비율(PR)과 상대 표준편차 분포를 기록하여 피드백 제어 및 강화 학습을 능가합니다.
  • 퍼셉트론 학습 방법은 평균이 1.0에 가까우며 분산이 낮은 PR 분포를 확보하여 다양한 워크로드에서 강력한 SLA 준수를 보입니다.
  • 10개의 랜덤 워크로드에 대해 퍼셉트론 학습은 90번째 백분위수 쿼리 비율을 1.37로 기록했으며, 이는 SLA 시간을 실제 추정 시간의 1.37배로 설정했을 때 90%의 쿼리가 목표를 충족하거나 초과했음을 의미합니다.
  • 퍼셉트론 학습은 강화 학습 및 피드백 제어와 달리 워크로드 별 복잡한 파rameter 조정이 필요로 하지 않아, 워크로드에 따라 유연하게 적용 가능합니다.
  • 시스템은 클라우드 제공자가 확률적 SLA를 자신 있게 광고할 수 있도록 하며, 예를 들어 추정 시간의 2배로 SLA 시간을 설정할 경우 90%의 쿼리가 SLA를 충족할 것임을 약속할 수 있습니다.
  • 로컬, 공유 자원이 없는 스토리지와 부분 복제를 활용함으로써 설정 시간이 단축되고 클러스터 재구성 시 교란이 최소화되어 신속하고 안정적인 스케일링이 가능해졌습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.