Skip to main content
QUICK REVIEW

[논문 리뷰] Hadoop Scheduling Base On Data Locality

Bo Jiang, Jiaying Wu|arXiv (Cornell University)|2015. 06. 01.
Cloud Computing and Resource Management참고 문헌 3인용 수 5
한 줄 요약

이 논문은 작업 국소성과 작업 완료 시간을 향상시키기 위해 자원 프리패칭을 활용하는 데이터 국소성 인지 Hadoop 스케줄링 알고리즘을 제안한다. 작업 완료 시간을 추정하고 작업 실행 이전에 데이터 블록을 후보 노드로 사전 전송함으로써, 더 나은 데이터 국소성을 확보하고 실험적으로 측정 가능한 성능 향상을 달성한다.

ABSTRACT

In hadoop, the job scheduling is an independent module, users can design their own job scheduler based on their actual application requirements, thereby meet their specific business needs. Currently, hadoop has three schedulers: FIFO, computing capacity scheduling and fair scheduling policy, all of them are take task allocation strategy that considerate data locality simply. They neither support data locality well nor fully apply to all cases of jobs scheduling. In this paper, we took the concept of resources-prefetch into consideration, and proposed a job scheduling algorithm based on data locality. By estimate the remaining time to complete a task, compared with the time to transfer a resources block, to preselect candidate nodes for task allocation. Then we preselect a non-local map tasks from the unfinished job queue as resources-prefetch tasks. Getting information of resources blocks of preselected map task, select a nearest resources blocks from the candidate node and transferred to local through network. Thus we would ensure data locality good enough. Eventually, we design a experiment and proved resources-prefetch method can guarantee good job data locality and reduce the time to complete the job to a certain extent.

연구 동기 및 목표

  • 기존 Hadoop 스케줄러(FIFO, Capacity, Fair)가 데이터 국소성을 효과적으로 지원하는 데에 한계가 있음을 해결하기 위해.
  • 사전 데이터 배치를 통해 데이터 전송 오버헤드를 줄임으로써 작업 스케줄링 효율을 향상시키기 위해.
  • 데이터 국소성과 추정된 작업 완료 시간을 기반으로 최적의 노드를 동적으로 선택하는 스케줄링 메커니즘을 설계하기 위해.
  • 자원 프리패칭의 효과를 평가하여 높은 데이터 국소성과 전체 작업 실행 시간 단축을 유지할 수 있는지 확인하기 위해.

제안 방법

  • 미완료 작업 큐에서 비국소 맵 작업을 식별하여 사전 데이터 전송의 후보로 삼는 자원 프리패칭 메커니즘을 도입한다.
  • 작업의 남은 완료 시간을 추정하고, 네트워크를 통해 데이터 블록을 전송하는 데 소요되는 시간과 비교한다.
  • 근접도와 네트워크 비용을 기반으로 후보 노드에서 가장 가까운 데이터 블록을 선택하여 대상 노드로 사전 전송한다.
  • 데이터 국소성과 전송 시간을 평가하여 작업 할당을 위한 노드를 사전 선택함으로써, 작업 실행 이전에 데이터가 로컬로 확보되도록 보장한다.
  • 작업 완료 시간 추정과 네트워크 인지 전송 전략을 조합한 하이브리드 전략을 사용하여 스케줄링 결정을 최적화한다.
  • 실시간 클러스터 상태와 작업 진행 상황을 기반으로 스케줄링 선택을 업데이트하는 피드백 기반 접근 방식을 활용한다.

실험 결과

연구 질문

  • RQ1자원 프리패칭은 현재 스케줄러가 달성하는 것보다 Hadoop 작업 스케줄링에서 데이터 국소성을 향상시킬 수 있는가?
  • RQ2작업 완료 시간을 추정하는 것은 데이터 전송 및 작업 할당 결정의 효율성에 어떤 영향을 미치는가?
  • RQ3분산 Hadoop 환경에서 사전 전송된 데이터 블록이 작업 완료 시간을 얼마나 줄일 수 있는가?
  • RQ4제안된 방법은 다양한 작업 워크로드와 클러스터 구성 조건에서도 양호한 데이터 국소성을 유지하는가?
  • RQ5데이터 전송 비용과 작업 실행 시간 간의 트레이드오프는 스케줄링 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 자원 프리패칭 방법은 작업 실행 이전에 데이터 블록을 후보 노드로 사전 이동시음으로써 데이터 국소성을 크게 향상시킨다.
  • 실험적 평가에서 작업 완료 시간이 감소하여, 실제 워크로드에서의 접근 방식의 효과성을 입증한다.
  • 기존 스케줄러보다 데이터 국소성과 네트워크 전송 비용 간의 균형을 더 잘 잡아 성능이 뛰어나다.
  • 동적이고 이질적인 클러스터 조건에서도 높은 데이터 국소성을 유지한다.
  • 추정된 완료 시간과 전송 비용을 기반으로 한 작업 스케줄링 결정은 더 효율적인 자원 활용을 이끈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.