Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Reliable (and Efficient) Job Executions in a Practical Geo-distributed Data Analytics System

Xiaoda Zhang, Zhuzhong Qian|arXiv (Cornell University)|2018. 02. 01.
Cloud Computing and Resource Management참고 문헌 24인용 수 6
한 줄 요약

이 논문은 네트워크 폭발적 변동성, 규제 제약, 불안정한 클라우드 인스턴스 등에 대응하기 위해 각 주권적 데이터 센터에 작업 관리자( job manager)를 유지하는 분산형 지리 분산 데이터 분석 시스템인 Houtu를 제안한다. 작업 지식이 없이도 협업식 작업 도용(cooperative work stealing)과 피드백 기반 자원 적응(feedback-driven resource adaptation)을 통해 넓은 지역 네트워크를 통해 효율적이고 신뢰성 있고 장애 내성적인 작업 실행을 실현하며, 중앙집중식 시스템과 유사한 성능을 달성한다. 이는 네트워크 상태가 불안정하거나 불안정한(Spot) 클라우드 인스턴스가 존재하는 환경에서도 작업의 신뢰성을 보장한다.

ABSTRACT

Geo-distributed data analytics are increasingly common to derive useful information in large organisations. Naive extension of existing cluster-scale data analytics systems to the scale of geo-distributed data centers faces unique challenges including WAN bandwidth limits, regulatory constraints, changeable/unreliable runtime environment, and monetary costs. Our goal in this work is to develop a practical geo-distribued data analytics system that (1) employs an intelligent mechanism for jobs to efficiently utilize (adjust to) the resources (changeable environment) across data centers; (2) guarantees the reliability of jobs due to the possible failures; and (3) is generic and flexible enough to run a wide range of data analytics jobs without requiring any changes. To this end, we present a new, general geo-distributed data analytics system, HOUTU, that is composed of multiple autonomous systems, each operating in a sovereign data center. HOUTU maintains a job manager (JM) for a geo-distributed job in each data center, so that these replicated JMs could individually and cooperatively manage resources and assign tasks. Our experiments on the prototype of HOUTU running across four Alibaba Cloud regions show that HOUTU provides nearly efficient job performance as in the existing centralized architecture, and guarantees reliable job executions when facing failures.

연구 동기 및 목표

  • 지역 간 네트워크 대역폭의 변동성, 규제 제약, 불안정한 클라우드 인스턴스 등 지리 분산 데이터 분석 환경에서 발생하는 과제를 해결하기 위해.
  • 동적이고 불안정한 환경(예: Spot 인스턴스)에서 장애가 발생하더라도 작업 신뢰성을 보장할 수 있는 시스템을 설계하기 위해.
  • 기존 데이터 분석 작업에 대한 수정 없이도 작업 특성에 대한 사전 지식 없이도 높은 성능과 효율성을 유지하기 위해.
  • 주권적 데이터 센터 간 데이터 소재성과 규제 경계를 고려한 자원 적응 및 작업 스케줄링을 가능하게 하기 위해.

제안 방법

  • 각 데이터 센터에 작업 관리자(JM)를 두어 지역 및 원격 자원을 자율적이고 협업적으로 관리할 수 있는 분산 아키텍처를 채택한다.
  • 작업 도용을 변환하여 노드 업데이트 이벤트로 처리하는 새로운 작업 도용 메커니즘을 사용하여 데이터 소재성을 유지하고 데이터 센터 간 데이터 이동을 최소화한다.
  • 예측이 아닌 과거 자원 활용도 피드백을 기반으로 자원 할당을 수행함으로써 변화하는 워크로드와 네트워크 조건에 동적으로 대응할 수 있다.
  • 각 작업 관리자는 이력 기반 자원 활용도를 바탕으로 독립적으로 자원을 요청, 유지 또는 해제함으로써 런타임 변화에 민감하게 반응한다.
  • 작업 수준의 장애 복구 메커니즘을 초월해 불안정한 Spot 인스턴스에서의 장애를 처리할 수 있는 작업 수준의 장애 내성 기능을 통합한다.
  • 각 데이터 센터 내에서 기존의 단일 데이터 센터 스케줄링 알고리즘(예: 적응형 피드백 및 매개변수화된 지연 스케줄링)을 활용하면서도, 협업식 작업 할당을 통해 데이터 센터 간 조율를 수행한다.

실험 결과

연구 질문

  • RQ1분산형 지리 분산 데이터 분석 시스템이 주권 및 규제 제약을 고려하면서도 중앙집중식 시스템과 유사한 성능을 달성할 수 있는가?
  • RQ2작업 특성에 대한 사전 지식이나 안정적인 네트워크 조건이 없이도 실시간으로 작업 스케줄링과 자원 할당을 어떻게 동적으로 적응시킬 수 있는가?
  • RQ3불안정한 Spot 인스턴스 환경에서 작업 수준의 장애 내성을 효과적으로 달성할 수 있는가? 이는 비용 효율성을 희생시키지 않으면서 신뢰성을 확보하는 데 기여하는가?
  • RQ4피드백 기반 자원 관리 방식이 동적이고 다중 지역 클라우드 환경에서 시스템 효율성을 얼마나 향상시킬 수 있는가?

주요 결과

  • Houtu는 이론적 경계를 통해 현실적인 조건 하에서 효율적으로 확장 가능함을 보여주며, 중심화된 아키텍처와 유사한 마케스팬(makespan) 성능을 달성한다.
  • WAN 대역폭이 짧은 간격 동안 크게 변동하더라도 Houtu는 작업 집합에 대해 평균 응답 시간을 낮게 유지한다.
  • 작업 수준의 장애 내성 기능을 통해 Spot 인스턴스의 장애 상황에서도 신뢰성 있는 작업 실행을 보장하며, 단지 작업 수준 복구에 의존하는 시스템보다 뛰어난 성능을 보인다.
  • 알리바바 클라우드의 네 개 지역에서 수행된 실험을 통해 Houtu가 실제 세계의 네트워크 변동성과 자원 불안정성 조건에서도 높은 효율성과 신뢰성을 유지함을 확인했다.
  • 작업 특성 분석이나 예측이 필요 없이도 피드백 기반 자원 적응 메커니즘이 워크로드 변화에 민감하게 반응할 수 있도록 하여 동적 자원 스케일링을 효과적으로 가능하게 한다.
  • 협업식 작업 도용 메커니즘이 데이터 센터 간 부하를 효과적으로 균형 잡으면서도 데이터 소재성 제약을 고려하여 데이터 센터 간 이동을 최소화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.