Skip to main content
QUICK REVIEW

[논문 리뷰] Elastic Processing of Analytical Query Workloads on IaaS Clouds

Herald Kllapi, Panos Sakkos|arXiv (Cornell University)|2015. 01. 06.
Advanced Database Systems and Queries참고 문헌 36인용 수 9
한 줄 요약

이 논문은 IaaS 클라우드 환경에서 분석 워크로드를 위한 탄력적이고 이윤 최적화된 쿼리 처리 엔진을 제안한다. 트리 구조의 실행 계획을 가상 머신 트리 레이아웃에 매핑하여 구현하며, SLA 기반 수익과 클라우드 자원 비용을 균형 잡는 온라인 알고리즘을 통해 워크로드에 따라 자원을 동적으로 스케일링한다. 이로 인해 상호작용 수준에 가까운 반응 시간을 달성하고, 정적 구성 대비 뚜렷하게 높은 수익성을 확보한다.

ABSTRACT

Many modern applications require the evaluation of analytical queries on large amounts of data. Such queries entail joins and heavy aggregations that often include user-defined functions (UDFs). The most efficient way to process these specific type of queries is using tree execution plans. In this work, we develop an engine for analytical query processing and a suite of specialized techniques that collectively take advantage of the tree form of such plans. The engine executes these tree plans in an elastic IaaS cloud infrastructure and dynamically adapts by allocating and releasing pertinent resources based on the query workload monitored over a sliding time window. The engine offers its services for a fee according to service-level agreements (SLAs) associated with the incoming queries; its management of cloud resources aims at maximizing the profit after removing the costs of using these resources. We have fully implemented our algorithms in the Exareme dataflow processing system. We present an extensive evaluation that demonstrates that our approach is very efficient (exhibiting fast response times), elastic (successfully adjusting the cloud resources it uses as the engine continually adapts to query workload changes), and profitable (approximating very well the maximum difference between SLA-based income and cloud-based expenses).

연구 동기 및 목표

  • 대규모 데이터에서 복잡한 분석 쿼리(중요한 집계 및 사용자 정의 함수(UDF))를 효율적이고 비용 효율적으로 처리하는 데 도전 과제를 해결하기 위해.
  • 실시간 워크로드 모니터링에 기반해 클라우드 자원 할당을 동적으로 조정하는 탄력적 쿼리 처리 엔진을 설계하기 위해.
  • 트리 기반 쿼리 실행 계획을 계층적 가상 머신 레이아웃에 자연스럽게 매핑하여 계산과 스토리지 간의 분리(디커플링)를 구현하기 위해.
  • 동적 자원 재구성 중 파artition 재할당 비용을 근사하기 위한 분석 모델을 개발하기 위해.
  • 기존의 정적 및 기존 시스템(예: Cloudera Impala)과 비교하여 시스템의 성능, 탄력성 및 수익성 평가하기 위해.

제안 방법

  • 엔진은 가상 머신(VMs)의 트리형 배포를 사용하며, 리프 VM들은 클라우드 스토리지(예: Amazon S3)에서 데이터를 가져오고 캐시한다. 더 높은 수준의 VM들은 부분 집계 및 전역 집계를 수행한다.
  • 온라인 슬라이딩 윈도우 기반 워크로드 모니터링 알고리즘이 변화하는 쿼리 워크로드에 대응해 동적으로 VM 할당 및 할당 해제를 이끈다.
  • 일관성 있는 해싱 확장 기법과 새로운 분석 비용 공식을 사용하여 VM 재구성 중 데이터 파artition 재할당 비용을 추정하고 최소화한다.
  • SLA 기반 수익(빠른 반응 시간일수록 높음)과 VM 사용 비용 간의 균형을 고려해 수익 최적화를 달성한다.
  • 이 방법은 Exareme 데이터플로우 시스템에 구현되었으며, 실제 워크로드 패턴과 워크로드를 사용해 평가되었다.

실험 결과

연구 질문

  • RQ1SLA 기반 반응 시간 요구사항을 충족하면서도 수익을 극대화하기 위해 분석 쿼리 엔진은 어떻게 클라우드 자원을 동적으로 스케일링할 수 있는가?
  • RQ2트리 기반 쿼리 실행 계획을 계층적 IaaS 인프라에 최적으로 매핑하는 방법은 무엇이며, 이를 통해 데이터 이동과 비용을 최소화할 수 있는가?
  • RQ3동적 VM 재구성 중 파artition 재할당 비용을 정확하게 추정하는 방법은 무엇이며, 이를 통해 효율적인 자원 적응이 가능할 수 있는가?
  • RQ4제안된 탄력적 엔진은 반응 시간, 적응 가능성 및 수익성 측면에서 정적 및 기존 시스템에 비해 어느 정도 뛰어나게 성능을 발휘하는가?

주요 결과

  • 제안된 탄력적 엔진은 동일한 워크로드에서 Cloudera Impala에 비해 뛰어난 성능을 보이며, 상호작용 수준에 가까운 반응 시간을 달성한다.
  • 시스템은 워크로드 변화에 신속하게 대응하며, 실험 단계에서 쿼리 패턴 변화에 따라 VM 할당을 신속히 조정하는 것으로 입증되었다.
  • 수익은 자원을 동적으로 스케일링함으로써 극대화된다. 예를 들어 Q3와 같은 더 비싼 쿼리의 경우, 수익성 있는 마진을 유지하기 위해 더 많은 컨테이너를 할당한다.
  • 파artition 재할당 비용에 대한 분석 모델은 효율적이고 정확한 재구성 결정을 가능하게 하여 탄력성 조정 시 오버헤드를 감소시킨다.
  • 정적 인프라 구성 대비 뚜렷하게 높은 수익성을 달성함으로써, 동적이고 SLA 인식 자원 관리의 가치를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.