[논문 리뷰] Practical Size-based Scheduling for MapReduce Workloads
이 논문은 Hadoop를 위한 실용적인 크기 기반, 사전 차단형 스케줄러인 HFSP를 제안한다. HFSP는 실행 중에 작업 크기를 동적으로 추정하고, 일찍이 사전 차단을 통해 작업 체류 시간을 최소화한다. 실제 작업 추적 자료를 바탕으로 평가한 결과, FIFO 및 FAIR 스케줄러에 비해 평균 작업 체류 시간을 크게 감소시켰으며, 공유형 다중 테넌트 클러스터에서 보다 뛰어난 공정성과 자원 활용도를 달성하였다.
We present the Hadoop Fair Sojourn Protocol (HFSP) scheduler, which implements a size-based scheduling discipline for Hadoop. The benefits of size-based scheduling disciplines are well recognized in a variety of contexts (computer networks, operating systems, etc...), yet, their practical implementation for a system such as Hadoop raises a number of important challenges. With HFSP, which is available as an open-source project, we address issues related to job size estimation, resource management and study the effects of a variety of preemption strategies. Although the architecture underlying HFSP is suitable for any size-based scheduling discipline, in this work we revisit and extend the Fair Sojourn Protocol, which solves problems related to job starvation that affect FIFO, Processor Sharing and a range of size-based disciplines. Our experiments, in which we compare HFSP to standard Hadoop schedulers, pinpoint at a significant decrease in average job sojourn times - a metric that accounts for the total time a job spends in the system, including waiting and serving times - for realistic workloads that we generate according to production traces available in literature.
연구 동기 및 목표
- Hadoop 워크로드가 소형 반복 작업에 의해 지배되는 상황에서 상호작용성 향상의 증가하는 수요를 해결하기 위해.
- 작업 체류 시간—작업이 대기 및 실행하는 데 소요되는 총 시간—을 감소시키되, 공정성 또는 클러스터 활용도를 희생시키지 않기 위해.
- 작업 크기가 사전에 알려지지 않은 실용적인 크기 기반 스케줄링 시스템을 설계하기 위해.
- 작업을 종료시키지 않고도 작업을 중단하고 재개할 수 있도록 허용하는 효율적인 복구를 가능하게 하는 사전 차단 메커니즘을 구현하기 위해.
- 실제 환경에서 사용되는 추적 자료 기반 워크로드를 사용하여, 생산 표준 스케줄러(FIFO 및 FAIR)와 HFSP를 비교 평가하기 위해.
제안 방법
- HFSP는 작업 진행률과 작업 실행 시간의 통계 모델을 기반으로 크기를 추론하는 플러그인형 작업 크기 추정 모듈을 사용한다.
- 작업 크기에 기반한 우선순위 부여와 음식물 부족 방지를 위해 수정된 Fair Sojourn 프로토콜을 구현하여, 낮은 체류 시간을 보장한다.
- 실행 중인 작업을 중단하고 재개할 수 있는 일찍이 사전 차단 원리를 적용하여 자원 낭비를 최소화한다.
- 추정된 작업 크기와 현재 클러스터 부하에 따라 자원 할당을 동적으로 조정한다.
- 기존 Hadoop 배포와의 통합을 가능하게 하기 위해 모듈식이고 오픈소스인 Hadoop 플러그인 아키텍처로 설계되어 있다.
- 평가를 위해 실제 환경의 워크로드 추적 자료를 사용하여 현실적인 작업 워크로드를 생성한다.
실험 결과
연구 질문
- RQ1사전에 작업 크기를 알지 못하는 상황에서 크기 기반 사전 차단 스케줄링 기법이 Hadoop에서 평균 작업 체류 시간을 크게 감소시킬 수 있는가?
- RQ2실제 워크로드 하에서 표준 Hadoop 스케줄러(FIFO 및 FAIR)와 비교해 HFSP는 체류 시간과 자원 활용도 측면에서 어떻게 성능을 내는가?
- RQ3일찍이 사전 차단과 작업 종료 방식의 차이가 시스템 효율성과 작업 완료 시간에 어떤 영향을 미치는가?
- RQ4작업 크기가 사전에 알려지지 않은 상황에서 동적 작업 크기 추정이 스케줄링 결정을 얼마나 효과적으로 향상시키는가?
- RQ5HFSP는 소형 상호작용형 작업을 우선시하면서도 작업 간 공정성을 유지할 수 있는가?
주요 결과
- HFSP는 실제 워크로드와 생산 수준의 추적 자료에서 FIFO 및 FAIR 스케줄러에 비해 평균 작업 체류 시간을 크게 감소시켰다.
- 체류 시간 감소 효과는 소형 및 중형 작업에서 가장 두드러지며, 크기에 기반한 우선순위 부여로 인해 대기 시간이 짧아져서 유리하다.
- HFSP는 높은 부하 상황에서도 높은 클러스터 활용도를 달성하여 효율적인 자원 관리 능력을 입증했다.
- 일찍이 사전 차단은 낭비된 작업을 줄이고 중단된 작업의 빠른 복구를 가능하게 하여, 작업 종료 방식보다 성능이 뛰어나다.
- 동적 크기 추정 모듈은 작업 진행률과 통계 모델을 사용하여 작업 지속 시간을 효과적으로 예측하여, 적절한 시점의 스케줄링 결정을 가능하게 했다.
- 오픈소스인 HFSP 스케줄러는 실제 Hadoop 클러스터에 배포 가능하며, 기존 Hadoop 구성 요소와의 통합이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.