Skip to main content
QUICK REVIEW

[논문 리뷰] Coded TeraSort

Songze Li, Sucha Supittayapornpong|arXiv (Cornell University)|2017. 02. 16.
IoT and Edge/Fog Computing인용 수 4
한 줄 요약

Coded TeraSort는 데이터 재분배 병목 현상을 줄이기 위해 데이터에 구조적 부울을 도입하고 네트워크 내에서의 코딩을 가능하게 하여 Hadoop MapReduce에서의 분산 정렬 알고리즘을 새롭게 제안한다. 아마존 EC2에서 평가한 결과, 일반 워크로드에서 기존 TeraSort 대비 1.97배에서 3.39배의 성능 향상을 달성하였다.

ABSTRACT

We focus on sorting, which is the building block of many machine learning algorithms, and propose a novel distributed sorting algorithm, named Coded TeraSort, which substantially improves the execution time of the TeraSort benchmark in Hadoop MapReduce. The key idea of Coded TeraSort is to impose structured redundancy in data, in order to enable in-network coding opportunities that overcome the data shuffling bottleneck of TeraSort. We empirically evaluate the performance of CodedTeraSort algorithm on Amazon EC2 clusters, and demonstrate that it achieves 1.97x - 3.39x speedup, compared with TeraSort, for typical settings of interest.

연구 동기 및 목표

  • Hadoop MapReduce 프레임워크 내 대규모 정렬 환경에서 발생하는 데이터 재분배 병목 현상을 해결하기 위해.
  • 분산 정렬을 위한 표준 워크로드인 TeraSort 벤치마크의 성능을 향상시키기 위해.
  • 정확성과 확장성에 손상을 주지 않으면서 네트워크 코딩 이점을 얻을 수 있는 코딩된 데이터 재분배 메커니즘을 설계하기 위해.
  • 아마존 EC2와 같은 실제 클라우드 환경에서 제안된 알고리즘의 성능 향상을 실증적으로 검증하기 위해.

제안 방법

  • MapReduce의 재분배 단계 동안 네트워크 내 코딩을 가능하게 하기 위해 입력 데이터에 구조적 부울을 도입하기 위해.
  • 데이터 파artitions를 코딩된 패킷으로 매핑하는 코딩 체계를 설계하여 수신자가 선형 조합을 사용해 누락된 데이터를 복원할 수 있도록 하기 위해.
  • 표준 재분배를 코딩된 재분배로 대체하여 코딩된 데이터 전송을 통합하는 MapReduce 파이프라인을 수정하기 위해.
  • 맵 및 리듀스 인터페이스를 유지함으로써 기존 Hadoop 인fra구조와의 후행 호환성을 확보하기 위해.
  • 재분배 단계에서 랜덤 선형 네트워크 코딩 원리를 활용해 코딩된 패킷을 생성하여 총 전송 수를 감소시키기 위해.
  • EC2 클러스터에서 실제 워크로드를 사용해 엔드 투 엔드 정렬 성능을 측정함으로써 알고리즘을 평가하기 위해.

실험 결과

연구 질문

  • RQ1데이터에 구조적 부울을 도입함으로써 MapReduce 정렬의 데이터 재분배 통신 비용을 줄일 수 있는가?
  • RQ2TeraSort 워크로드에서 네트워크 내 코딩을 활성화함으로써 얻을 수 있는 성능 향상은 어느 정도인가?
  • RQ3클라우드 기반 Hadoop 클러스터에서 코딩된 재분배가 엔드 투 엔드 정렬 지연에 어떤 영향을 미치는가?
  • RQ4기존 TeraSort 대비 코딩된 접근 방식이 다양한 클러스터 크기와 데이터 볼륨에서 어떻게 확장성과 성능을 발휘하는가?
  • RQ5제안된 방법은 표준 Hadoop MapReduce와의 정확성과 호환성을 유지하면서 성능 향상을 달성할 수 있는가?

주요 결과

  • Coded TeraSort는 일반 워크로드 하에서 아마존 EC2 클러스터에서 표준 TeraSort 대비 1.97배에서 3.39배의 성능 향상을 달성한다.
  • 성능 향상의 주요 원인은 네트워크 내 코딩으로 인해 감소된 데이터 재분배 오버헤드이다.
  • 알고리즘은 저수준 수정 없이도 기존 Hadoop MapReduce 프레임워크와 호환성을 유지한다.
  • 성능 향상은 다양한 클러스터 크기와 데이터 볼륨에서 일관되게 유지되어 확장성을 입증한다.
  • 구조적 부울의 사용은 리듀서 노드에서 효율적인 복원을 가능하게 하여 계산 오버헤드를 최소화한다.
  • 실증 결과는 코딩된 재분배가 정렬 파이프라인의 병목 현상을 크게 줄임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.