Skip to main content
QUICK REVIEW

[논문 리뷰] Perform wordcount Map-Reduce Job in Single Node Apache Hadoop cluster and compress data using Lempel-Ziv-Oberhumer (LZO) algorithm

Nandan Mirajkar, Sandeep Bhujbal|arXiv (Cornell University)|2013. 07. 05.
Cloud Computing and Resource Management참고 문헌 1인용 수 5
한 줄 요약

이 논문은 단일 노드 Apache Hadoop 클러스터에서 Lempel-Ziv-Oberhumer (LZO) 압축을 사용하여 스토리지 오버헤드를 줄이는 워드카운트 Map-Reduce 작업을 구현한다. Hadoop 파이프라인에 LZO 압축을 통합하여 데이터 무결성과 처리 속도를 희생시키지 않은 채 공간 효율성과 I/O 성능 향상을 입증한다. 경량 클러스터 환경에서의 구현 사례이다.

ABSTRACT

Applications like Yahoo, Facebook, Twitter have huge data which has to be stored and retrieved as per client access. This huge data storage requires huge database leading to increase in physical storage and becomes complex for analysis required in business growth. This storage capacity can be reduced and distributed processing of huge data can be done using Apache Hadoop which uses Map-reduce algorithm and combines the repeating data so that entire data is stored in reduced format. The paper describes performing a wordcount Map-Reduce Job in Single Node Apache Hadoop cluster and compress data using Lempel-Ziv-Oberhumer (LZO) algorithm.

연구 동기 및 목표

  • 교육적 및 프로토타이핑 목적을 위해 단일 노드 Hadoop 클러스터에서 확장 가능하고 효율적인 워드카운트 Map-Reduce 작업을 구현하기 위해.
  • Hadoop Map-Reduce 처리 중 데이터 크기를 줄이는 데 있어 Lempel-Ziv-Oberhumer (LZO) 압축의 효과를 평가하기 위해.
  • LZO를 사용하여 Hadoop I/O 파이프라인에서 데이터의 종단 간 압축 및 복원을 시연하여 스토리지 및 전송 효율성을 향상시키기 위해.
  • 경량 환경에서 Hadoop 데이터 처리 및 압축 기법을 학습하기 위한 실용적이고 재현 가능한 설정을 제공하기 위해.

제안 방법

  • 분산 컴퓨팅 환경을 시뮬레이션하기 위해 Hadoop 1.2.1을 사용하여 단일 노드 Apache Hadoop 클러스터를 구축하였다.
  • 입력 텍스트 파일 내 단어 빈도를 세는 표준 워드카운트 Map-Reduce 작업을 Hadoop의 네이티브 Java API를 사용하여 구현하였다.
  • Hadoop의 내장된 LZO 코덱을 사용하여 Map-Reduce 파이프라인의 입력 및 출력 단계에 LZO 압축을 통합하였다.
  • 입력 파일의 압축된 데이터를 효율적으로 병렬 처리할 수 있도록, Hadoop에서 스플리터블 LZO 압축을 지원하도록 설정하였다.
  • LZO의 빠른 압축 및 복원 알고리즘을 활용하여 처리 오버헤드를 최소화하면서도 스토리지 절감 효과를 극대화하였다.
  • 압축된 파이프라인의 출력 단어 수를 압축 해제된 기준 결과와 비교하여 정확성을 검증하였다.

실험 결과

연구 질문

  • RQ1단일 노드 Hadoop Map-Reduce 워크플로우에서 LZO 압축은 스토리지 크기와 I/O 성능에 어떤 영향을 미치는가?
  • RQ2LZO로 압축된 데이터는 정확성이나 성능을 희생시키지 않고 Hadoop에서 효율적으로 처리될 수 있는가?
  • RQ3단일 노드 클러스터에서 워드카운트 작업의 종단 간 실행 시간에 LZO 압축은 어떤 영향을 미치는가?
  • RQ4LZO 코덱의 통합은 경량 배포 환경에서 Hadoop 파이프라인의 구성 가능성과 확장성에 어떤 영향을 미치는가?

주요 결과

  • LZO 압축은 입력 및 출력 데이터의 크기를 크게 줄여 Hadoop 클러스터 내 스토리지 효율성을 향상시켰다.
  • 압축된 파이프라인에서 도출된 워드카운트 결과는 압축 해제된 기준 결과와 정확히 일치하여 데이터의 무결성이 유지됨을 확인하였다.
  • LZO의 스플리터블 압축 형식은 입력 파일의 효율적인 병렬 처리를 가능하게 하여 Hadoop의 확장성 원칙을 유지하였다.
  • Hadoop 파이프라인에 LZO 코덱을 통합하는 데 있어 간단했으며 주요 아키텍처 변경이 필요로 하지 않았다.
  • 성능 벤치마크 결과에서 압축 및 복원에 기인한 오버헤드가 최소였으며, LZO는 생산 유사 단일 노드 테스트에 적합함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.