[논문 리뷰] On the Optimality of Scheduling Dependent MapReduce Tasks on Heterogeneous Machines.
이 논문은 이질적 머신에서 종속적인 MapReduce 작업을 위한 새로운 스케줄링 알고리즘인 DMRS를 제안하며, 가중 완료 시간을 최소화하는 것을 목표로 한다. 작업 의존성과 서버 이질성을 모델링함으로써 DMRS는 $2(1+(m-1)/D)+1$의 경쟁 비율을 확보하고, Hadoop 평가에서 기준 스케줄러 대비 작업 완료 시간을 최대 82% 감소시킨다.
MapReduce is the most popular big-data computation framework, motivating many research topics. A MapReduce job consists of two successive phases, i.e. map phase and reduce phase. Each phase can be divided into multiple tasks. A reduce task can only start when all the map tasks finish processing. A job is successfully completed when all its map and reduce tasks are complete. The task of optimally scheduling the different tasks on different servers to minimize the weighted completion time is an open problem, and is the focus of this paper. In this paper, we give an approximation ratio with a competitive ratio $2(1+(m-1)/D)+1$, where $m$ is the number of servers and $D\ge 1$ is the task-skewness product. We implement the proposed algorithm on Hadoop framework, and compare with three baseline schedulers. Results show that our DMRS algorithm can outperform baseline schedulers by up to $82\%$.
연구 동기 및 목표
- 이질적 머신에서 종속적인 MapReduce 작업을 최적화하여 가중 완료 시간을 최소화하는 열린 문제를 해결하기 위해.
- 분산 MapReduce 환경에서 작업 의존성과 서버 이질성을 고려한 스케줄링 알고리즘을 설계하기 위해.
- 실제 Hadoop 배포 환경에서 기존 스케줄러와의 성능을 평가하기 위해.
- 동적이고 비대칭적인 워크로드 하에서 스케줄링 알고리즘의 이론적 경쟁 비율을 확립하기 위해.
제안 방법
- 제안된 DMRS 알고리즘은 가중 완료 시간 최소화 기반의 작업 우선순위를 고려하여 작업 의존성과 서버 이질성을 모델링하여 스케줄링을 우선순위 기반으로 수행한다.
- 이 알고리즘은 $2(1+(m-1)/D)+1$의 경쟁 비율을 유도하며, 여기서 $m$은 서버 수이고 $D \to 1$은 작업 비대칭성 곱이다.
- 알고리즘은 이질적 머신 간의 작업 실행 시간과 데이터 국소성 모두를 고려한 우선순위 기반 스케줄링 전략을 사용한다.
- 예상 처리 시간과 의존성 제약 조건을 기반으로 동적으로 맵 및 리듀스 작업을 서버에 할당한다.
- 부하 균형을 개선하고 작업 전환 시간을 줄이기 위해 가중 완료 시간 목표 함수를 스케줄링 논리에 통합한다.
- 알고리즘은 실제 워크로드와 기준 스케줄러 비교를 통해 Hadoop 프레임워크 내에서 구현 및 평가되었다.
실험 결과
연구 질문
- RQ1이질적 머신에서 종속적인 MapReduce 작업을 위한 스케줄링 알고리즘의 이론적 경쟁 비율은 무엇인가?
- RQ2작업 비대칭성과 서버 이질성은 MapReduce 작업 스케줄링 성능에 어떤 영향을 미치는가?
- RQ3히우리스틱 스케줄링 알고리즘이 가중 완료 시간 측면에서 기존 기준 스케줄러를 초월할 수 있는가?
- RQ4이질적 클러스터에서 작업 의존성과 데이터 국소성은 스케줄링 효율성에 어떤 영향을 미치는가?
주요 결과
- 제안된 DMRS 알고리즘은 $2(1+(m-1)/D)+1$의 경쟁 비율을 확보하여 종속적인 MapReduce 작업 스케줄링에 대한 성능 이론적 한계를 제공한다.
- Hadoop 기반 평가에서 DMRS는 기준 스케줄러 대비 가중 완료 시간을 최대 82% 감소시켜 성능을 뛰어나게 한다.
- 알고리즘은 작업 의존성과 서버 이질성을 효과적으로 처리하여 부하 균형 개선과 작업 완료 효율성 향상을 이룬다.
- 성능 향상은 높은 작업 비대칭성과 이질적 서버 구성 조건에서 가장 두드러지며, 알고리즘의 강건성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.