Skip to main content
QUICK REVIEW

[논문 리뷰] A Cost-based Storage Format Selector for Materialization in Big Data Frameworks

Rana Faisal Munir, Alberto Abelló|ArXiv.org|2018. 06. 11.
Cloud Computing and Resource Management참고 문헌 22인용 수 3
한 줄 요약

이 논문은 대규모 데이터 워크플로우에서 materialized 결과의 최적 데이터 레이아웃—수평, 수직, 또는 하이브리드—를 동적으로 선택하는 비용 기반 스토리지 포맷 선택기 기법을 제안한다. 액세스 패턴을 분석하고 HDFS에서 SequenceFile, Avro, Parquet에 기반한 일반적인 비용 모델을 적용하여, 고정 포맷 솔루션 대비 평균 25% 향상된 성능을 달성한다.

ABSTRACT

Modern big data frameworks (such as Hadoop and Spark) allow multiple users to do large-scale analysis simultaneously. Typically, users deploy Data-Intensive Workflows (DIWs) for their analytical tasks. These DIWs of different users share many common parts (i.e, 50-80%), which can be materialized to reuse them in future executions. The materialization improves the overall processing time of DIWs and also saves computational resources. Current solutions for materialization store data on Distributed File Systems (DFS) by using a fixed data format. However, a fixed choice might not be the optimal one for every situation. For example, it is well-known that different data fragmentation strategies (i.e., horizontal, vertical or hybrid) behave better or worse according to the access patterns of the subsequent operations. In this paper, we present a cost-based approach which helps deciding the most appropriate storage format in every situation. A generic cost-based storage format selector framework considering the three fragmentation strategies is presented. Then, we use our framework to instantiate cost models for specific Hadoop data formats (namely SequenceFile, Avro and Parquet), and test it with realistic use cases. Our solution gives on average 33% speedup over SequenceFile, 11% speedup over Avro, 32% speedup over Parquet, and overall, it provides upto 25% performance gain.

연구 동기 및 목표

  • 고정된 스토리지 포맷이 레이아웃이 맞지 않아 성능이 저하되는 대규모 데이터 프레임워크의 한계를 해결하기 위해.
  • 후속 쿼리 패턴에 기반하여 최적의 분할 전략(수평, 수직, 하이브리드)을 선택하여 materialized 결과의 로드 시간을 단축하기 위해.
  • Hadoop 환경에서 다양한 스토리지 포맷 간 I/O 작업을 위한 일반적이고 확장 가능한 비용 모델을 설계하기 위해.
  • 실세계 의사결정 지원 벤치마크를 대상으로 프레임워크를 평가하여 고정 포맷 대비 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 수평, 수직, 하이브리드 데이터 분할 전략에 대한 읽기 및 왤기 비용을 추정하는 일반적인 I/O 비용 모델을 개발한다.
  • 쿼리 워크로드에서 유도된 통계 메타데이터를 사용하여 Hadoop 네이티브 형식 3종—SequenceFile, Avro, Parquet—에 비용 모델을 적용한다.
  • 냉각기 동안 룰 기반 히وري스틱을 사용하고 통계 수집 후 비용 기반 선택으로 전환하는 하이브리드 선택기 프레임워크를 구현한다.
  • 이중 단계 접근 방식을 사용한다: 초기 메타데이터 수집 단계에서 룰 기반 레이아웃 선택을 수행하고, 이후에는 비용 모델 기반의 형식 선택을 수행한다.
  • 실세계 DSS 벤치마크(TPC-H 및 TPC-DS)를 활용하여 다양한 워크로드에서의 성능을 평가한다.
  • 실제 I/O 측정치와 쿼리 액세스 패턴에서 유도된 비용 모델 파rameter를 활용하여 형식 선택을 안내한다.

실험 결과

연구 질문

  • RQ1비용 기반 접근 방식을 통해 대규모 데이터 워크플로우에서 materialized 결과의 성능을 최적의 스토리지 포맷 선택을 통해 어떻게 향상시킬 수 있는가?
  • RQ2HDFS에서 수평, 수직, 하이브리드 데이터 레이아웃 간 I/O 성능에 영향을 주는 주요 비용 요소는 무엇인가?
  • RQ3실세계 분석 워크로드에서 동적 형식 선택이 고정 포맷 스토리지보다 얼마나 뛰어난가?
  • RQ4비용 모델의 정확도와 성능은 다양한 데이터 형식(SequenceFile, Avro, Parquet)과 워크로드 간에 어떻게 달라지는가?
  • RQ5규칙 기반과 비용 기반 전략을 융합한 하이브리드 전략은 냉각기 오버헤드를 효과적으로 극복하고 장기적인 성능 향상 달성에 기여하는가?

주요 결과

  • 제안된 시스템은 materialized 결과 로딩에서 SequenceFile 대비 평균 33% 향상, Avro 대비 11%, Parquet 대비 32% 향상된 성능을 달성한다.
  • 전반적으로, 이 프레임워크는 어떤 하나의 고정된 스토리지 포맷 대비 최대 25% 평균 성능 향상을 제공한다.
  • 비용 모델은 액세스 패턴에 기반하여 최적의 레이아웃을 효과적으로 식별하여 데이터 집약적 워크플로우에서 I/O 오버헤드를 감소시킨다.
  • 룰 기반에서 비용 기반 선택으로의 전환은 초기 메타데이터 수집 후 형식 선택 정확도가 크게 향상됨을 보여준다.
  • TPC-H 및 TPC-DS 벤치마크를 포함한 다양한 분석 워크로드에서 프레임워크는 일관된 성능 향상을 보였다.
  • 심지어 특정 워크로드에 대해 수작업으로 최적화된 고정 포맷 대비 동적 레이아웃 선택이 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.