Skip to main content
QUICK REVIEW

[논문 리뷰] Optimization and analysis of large scale data sorting algorithm based on Hadoop

Zhuo Wang, Longlong Tian|arXiv (Cornell University)|2015. 06. 01.
Graph Theory and Algorithms참고 문헌 2인용 수 4
한 줄 요약

이 논문은 Hadoop에서 대규모 데이터를 위한 최적화된 다중 라운드 MapReduce 기반 정렬 알고리즘을 제안한다. 무작위 표본 추출과 리듀서 간 균형 잡힌 데이터 분포를 통해 로드 불균형을 줄인다. 실험 결과, 대규모 데이터셋에서 네이티브 Hadoop 셔플 정렬보다 효율성과 확장성 면에서 뛰어난 성능을 보였다.

ABSTRACT

When dealing with massive data sorting, we usually use Hadoop which is a framework that allows for the distributed processing of large data sets across clusters of computers using simple programming models. A common approach in implement of big data sorting is to use shuffle and sort phase in MapReduce based on Hadoop. However, if we use it directly, the efficiency could be very low and the load imbalance can be a big problem. In this paper we carry out an experimental study of an optimization and analysis of large scale data sorting algorithm based on hadoop. In order to reach optimization, we use more than 2 rounds MapReduce. In the first round, we use a MapReduce to take sample randomly. Then we use another MapReduce to order the data uniformly, according to the results of the first round. If the data is also too big, it will turn back to the first round and keep on. The experiments show that, it is better to use the optimized algorithm than shuffle of MapReduce to sort large scale data.

연구 동기 및 목표

  • 대규모 데이터 처리에서 Hadoop의 네이티브 셔플 기반 정렬의 비효율성과 로드 불균형 문제를 해결하기 위해.
  • 데이터 왜곡을 최소화하고 정렬 처리량을 향상시키기 위한 확장성 있는 분산 정렬 알고리즘을 설계하기 위해.
  • 다양한 데이터 크기에서 표준 Hadoop MapReduce 정렬과 비교하여 제안된 알고리즘의 성능을 평가하기 위해.
  • 표본 추출 및 데이터 분포 전략이 클러스터 환경에서 정렬 효율성에 미치는 영향을 분석하기 위해.

제안 방법

  • 알고리즘은 다중 MapReduce 라운드를 사용한다: 첫 번째 라운드는 데이터셋의 무작위 표본 추출을 통해 데이터 분포를 추정한다.
  • 두 번째 MapReduce 라운드는 표본 결과를 바탕으로 파artition 범위 경계를 정의하여 리듀서 간 균형 잡힌 데이터 분포를 가능하게 한다.
  • 초기 파artition 후에도 데이터가 너무 크면, 표본 추출 및 파artition 단계를 반복적으로 반복하여 데이터가 관리 가능한 파artition에 맞출 때까지 진행한다.
  • 이 방법은 Hadoop의 MapReduce 모델을 활용하지만, 파artition 로직을 수정하여 왜곡을 줄이고 로드 밸런싱을 향상시킨다.
  • 이러한 접근은 일반적으로 대규모 정렬에서 불균형한 리듀서 로드를 유발하는 Hadoop의 기본 해시 기반 파artition에 의존하지 않는다.
  • 알고리즘은 표본 데이터 통계에 기반한 커스터마이징된 파artition 로직을 사용하여 표준 Hadoop API로 구현된다.

실험 결과

연구 질문

  • RQ1다중 라운드 표본 추출 및 파artition가 대규모 데이터 처리에서 Hadoop의 기본 셔플 대비 정렬 성능을 어떻게 향상시키는가?
  • RQ2제안된 알고리즘이 대규모 정렬 중 리듀서 간 로드 불균형을 어느 정도 줄이는가?
  • RQ3최적화된 알고리즘의 성능 향상은 실행 시간과 자원 활용도 측면에서 얼마나 되는가?
  • RQ4데이터 볼륨 증가에 따라 알고리즘이 어떻게 확장되는가? 반복적 표본 추출이 언제 필요해지는가?

주요 결과

  • 표본 데이터를 활용한 균형 잡힌 파artition를 통해 최적화된 알고리즘이 로드 불균형을 크게 감소시켰다.
  • 성능 평가 결과, 제안된 방법이 네이티브 Hadoop 셔플 정렬 대비 실행 시간과 확장성 면에서 뛰어난 성능을 보였다.
  • 반복적 표본 추출을 포함한 다중 MapReduce 라운드를 통해 단일 라운드 처리 용량을 초월하는 매우 큰 데이터셋을 효과적으로 처리할 수 있었다.
  • 표본 추출에 기반한 범위 기반 파artition로 기본 해시 파artition를 대체함으로써 더 나은 데이터 분포와 높은 처리량을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.