Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Straggler Replication in Large-scale Parallel Computing

Wang Da, Gauri Joshi|arXiv (Cornell University)|2015. 03. 11.
Cloud Computing and Resource Management참고 문헌 24인용 수 5
한 줄 요약

이 논문은 대규모 병렬 컴퓨팅에서 느린 작업(스트래글러)의 복제를 최적화하기 위한 수학적 프레임워크를 제안하며, 작업 지연과 계산 비용 간의 트레이드오프를 분석한다. 작업 실행 시간을 모델링하고 복제 전략(언제 복제할 것인지, 몇 개의 복제본을 생성할 것인지, 원본 작업을 종료할 것인지 여부)을 최적화함으로써, 조그만 복제조차도 지연을 크게 줄이고 자원 비용을 낮출 수 있음을 보여주며, 특히 파레토와 같은 꼬리가 무거운 실행 시간 분포 하에서 특히 그렇다.

ABSTRACT

In a cloud computing job with many parallel tasks, the tasks on the slowest machines (straggling tasks) become the bottleneck in the job completion. Computing frameworks such as MapReduce and Spark tackle this by replicating the straggling tasks and waiting for any one copy to finish. Despite being adopted in practice, there is little analysis of how replication affects the latency and the cost of additional computing resources. In this paper we provide a framework to analyze this latency-cost trade-off and find the best replication strategy by answering design questions such as: 1) when to replicate straggling tasks, 2) how many replicas to launch, and 3) whether to kill the original copy or not. Our analysis reveals that for certain execution time distributions, a small amount of task replication can drastically reduce both latency as well as the cost of computing resources. We also propose an algorithm to estimate the latency and cost based on the empirical distribution of task execution time. Evaluations using samples in the Google Cluster Trace suggest further latency and cost reduction compared to the existing replication strategy used in MapReduce.

연구 동기 및 목표

  • 대규모 병렬 작업에서 느린 작업으로 인한 지연 장애를 해결하기 위해.
  • 작업 복제로 인한 추가 계산 자원 비용과 작업 완료 시간 간의 트레이드오프를 분석하기 위해.
  • 시점, 복제 수, 원본 작업 처리 방식을 고려하여 지연과 비용을 모두 최소화하는 최적의 복제 전략을 설계하기 위해.
  • 해석 형태가 복잡한 경우에도 경험적 실행 시간 분포로부터 지연과 비용을 추정할 수 있는 실용적 알고리즘을 개발하기 위해.
  • 실제 클러스터 추적 데이터를 사용하여 기존 MapReduce 시스템과 비교하여 제안된 전략을 검증하기 위해.

제안 방법

  • 복제된 스트래글러 작업의 완료 시간을 모델링하기 위해 순서 통계 및 극값 이론을 사용하여 문제를 수식화한다.
  • 다양한 실행 시간 분포 하에서 복제된 작업의 최소값의 점근적 분포를 기술하기 위해 도메인의 도래 이론을 적용한다.
  • 원본 작업을 종료하거나 유지하는 전략을 포함한 다양한 복제 정책 하에서 기대 작업 완료 시간과 기대 비용에 대한 닫힌 형태의 수식을 유도한다.
  • 해석 형태가 복잡한 경우 경험적 작업 실행 시간 분포로부터 성능 지표를 추정하기 위한 알고리즘을 제안한다.
  • 클라우드 환경에서 흔한 꼬리가 무거운 실행 시간을 모델링하기 위해 일반화된 파레토 분포와 극값 이론을 활용한다.
  • 실제 Google 클러스터 추적 데이터를 사용하여 기존 MapReduce 스타일의 복제 전략과 비교하여 프레임워크의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1지연을 최소화하면서 자원 비용을 통제하기 위해 복제할 작업의 최적 비율은 무엇인가?
  • RQ2각 스트래글러 작업에 대한 복제본 수가 지연-비용 트레이드오프에 어떻게 영향을 미치는가?
  • RQ3복제 후 원본 작업은 종료할 것인지, 계속 실행할 것인가?
  • RQ4어떤 실행 시간 분포 하에서 최소 복제로 인해 지연 감소 효과가 가장 크고 비용 증가가 최소가 되는가?
  • RQ5경험적 작업 실행 시간 데이터로부터 지연과 비용 성능 지표를 정확하게 추정하는 방법은 무엇인가?

주요 결과

  • 파레토와 같은 꼬리가 무거운 실행 시간 분포 하에서는 조그만 비율의 스트래글러 작업 복제만으로도 작업 완료 시간을 크게 줄일 수 있다.
  • 스트래글러 작업을 복제하면 비복제 작업 대비 지연을 최대 140배까지 줄일 수 있으며, 자원 비용 증가는 미미하다.
  • 최적의 복제 전략은 실행 시간 분포의 꼬리 행동에 따라 달라지며, 파레토 분포를 따르는 작업은 복제로 가장 큰 이점을 얻는다.
  • 복제 후 원본 작업을 종료하는 전략은 특히 복제 비율이 높을 경우 원본 작업을 유지하는 것보다 기대 비용이 낮고 완료가 빠르다.
  • 경험적 분포로부터 지연과 비용을 추정하는 데 사용된 제안된 알고리즘은 Google 클러스터 추적 데이터에서 베이스라인 MapReduce 복제 전략보다 뛰어난 성능을 보였다.
  • 이 프레임워크는 지연과 총 비용 둘 다를 줄이는 영역를 드러내며, 일반적으로 지연을 낮추기 위해서는 자원 사용이 늘어나야 한다는 일반적인 가정을 뒤집는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.