Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale Data Modelling in Hive and Distributed Query Processing using MapReduce and Tez

Abzetdin Adamov|arXiv (Cornell University)|2023. 01. 29.
Cloud Computing and Resource Management인용 수 4
한 줄 요약

이 논문은 Hadoop 생태계 내에서 MapReduce 및 Tez 엔진을 사용하여 대규모 데이터 모델링 및 분산 쿼리 처리에서 Apache Hive의 역할을 조사한다. Hive의 데이터 정의 및 조작 기능을 평가한 결과, Tez는 최적화된 실행 엔진과 감소된 I/O 오버헤드 덕분에 MapReduce보다 쿼리 처리 성능이 뛰어나다는 것을 입증한다.

ABSTRACT

Huge amounts of data being generated continuously by digitally interconnected systems of humans, organizations and machines. Data comes in variety of formats including structured, unstructured and semi-structured, what makes it impossible to apply the same standard approaches, techniques and algorithms to manage and process this data. Fortunately, the enterprise level distributed platform named Hadoop Ecosystem exists. This paper explores Apache Hive component that provides full stack data managements functionality in terms of Data Definition, Data Manipulation and Data Processing. Hive is a data warehouse system, which works with structured data stored in tables. Since, Hive works on top the Hadoop HDSFS, it benefits from extraordinary feature of HDFS including Fault Tolerance, Reliability, High Availability, Scalability, etc. In addition, Hive can take advantage of distributed computing power of the cluster through assigning jobs to MapReduce, Tez and Spark engines to run complex queries. The paper is focused on studying of Hive Data Model and analysis of processing performance done by MapReduce and Tez.

연구 동기 및 목표

  • 대규모 환경에서 구조화된, 반구조화된, 비구조화된 데이터 형식에 걸쳐 Hive의 데이터 모델링 기능을 분석하기 위해.
  • Hive 쿼리의 실행 엔진으로서 MapReduce와 Tez 간의 성능 차이를 평가하기 위해.
  • 분산 데이터 처리에서 HDFS의 장애 복구, 확장성, 고가용성 기능을 Hive가 어떻게 활용하는지 평가하기 위해.
  • 복잡한 쿼리 실행 워크플로우에서 Tez가 MapReduce에 비해 가지는 아키텍처적 이점을 식별하기 위해.

제안 방법

  • SQL 유사 DDL 및 DML 작업을 통해 구조화된 데이터를 관리하기 위해 Apache Hive를 데이터 웨어하우스 시스템으로 활용하였다.
  • HDFS 스토리지가 구축된 Hadoop 클러스터에서 복잡한 분석 쿼리를 MapReduce 및 Tez 엔진을 모두 사용하여 실행하였다.
  • 엔진 간 성능 비교를 위해 쿼리 실행 시간, I/O 연산 수, 작업 완료 비율을 측정하였다.
  • 작업 실행 계획과 DAG 구조를 분석하여 MapReduce와 Tez 간 최적화 차이를 이해하였다.
  • 다양한 데이터 크기와 복잡도에서 쿼리 성능을 벤치마크하기 위해 실제 워크로드 데이터를 사용하였다.
  • HDFS 및 Hive 통합에서 제공하는 장애 복구, 확장성, 고가용성 기능의 영향을 평가하였다.

실험 결과

연구 질문

  • RQ1Hive는 구조화된, 반구조화된, 비구조화된 데이터 형식 간에 대규모 데이터 모델링을 어떻게 지원하는가?
  • RQ2복잡한 Hive 쿼리를 처리할 때 MapReduce와 Tez 간의 성능 차이는 무엇인가?
  • RQ3Hive는 분산 쿼리 실행에서 장애 복구 및 확장성 등의 HDFS 기능을 어떻게 활용하는가?
  • RQ4Tez는 MapReduce에 비해 얼마나 많은 I/O 오버헤드를 줄이고 작업 실행 효율성을 향상시키는가?
  • RQ5Hive에서 복잡한 쿼리 실행 워크플로우 최적화에 있어 Tez가 제공하는 아키텍처적 이점은 무엇인가?

주요 결과

  • Tez는 효율적인 DAG 기반 실행 모델 덕분에 복잡하고 다단계 쿼리에서 MapReduce보다 쿼리 실행 시간이 빠르게 나타났다.
  • MapReduce는 맵 단계와 리듀스 단계 사이의 중간 데이터 스플래시로 인해 더 높은 I/O 오버헤드를 보였다.
  • Hive는 HDFS에 저장된 대규모 데이터에서 SQL 유사 작업을 가능하게 하여 복잡한 데이터 처리 로직을 효과적으로 추상화하였다.
  • Hive와 HDFS의 통합은 클러스터 노드 간 고가용성, 장애 복구, 수평 확장성을 보장하였다.
  • Tez는 중간 작업 단계 수를 줄여 더 빠른 작업 완료 및 자원 소비 감소를 이끌었다.
  • 성능 벤치마크 결과, ETL 및 분석 워크로드에서 Tez를 사용할 경우 처리량과 지연 시간에 명확한 향상이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.