Skip to main content
QUICK REVIEW

[논문 리뷰] Equi-depth Histogram Construction for Big Data with Quality Guarantees

Burak Yildiz, Tolga Büyüktanır|arXiv (Cornell University)|2016. 06. 17.
Cloud Computing and Resource Management참고 문헌 27인용 수 6
한 줄 요약

이 논문은 대용량 데이터에서 정확한 히스토그램을 사전에 계산한 데이터 파artitions에서의 히스토그램을 기반으로, 버킷 크기와 범위 쿼리에 대해 최대 $2\beta/T$의 오차가 보장되는 새로운 머지 기반 방법을 제안한다. 이 방법은 Hadoop에서 이론적이고 경험적으로도 정확도가 보장되는 효율적인 온디맨드 히스토그램 생성을 가능하게 하며, 오차의 일관성과 정밀도에서 기존의 튜플 수준 샘플링을 능가하지만, 낮은 오프라인 계산 비용만을 수반한다.

ABSTRACT

The amount of data generated and stored in cloud systems has been increasing exponentially. The examples of data include user generated data, machine generated data as well as data crawled from the Internet. There have been several frameworks with proven efficiency to store and process the petabyte scale data such as Apache Hadoop, HDFS and several NoSQL frameworks. These systems have been widely used in industry and thus are subject to several research. The proposed data processing techniques should be compatible with the above frameworks in order to be practical. One of the key data operations is deriving equi-depth histograms as they are crucial in understanding the statistical properties of the underlying data with many applications including query optimization. In this paper, we focus on approximate equi-depth histogram construction for big data and propose a novel merge based histogram construction method with a histogram processing framework which constructs an equi-depth histogram for a given time interval. The proposed method constructs approximate equi-depth histograms by merging exact equi-depth histograms of partitioned data by guaranteeing a maximum error bound on the number of items in a bucket (bucket size) as well as any range on the histogram.

연구 동기 및 목표

  • 실시간 분석을 위한 대규모 분산 데이터셋에 대해 정확한 등분포 히스토그램을 구축하는 데 도전하는 데 목적을 두며.
  • 확장 가능한 대용량 데이터 처리를 위한 Hadoop 및 NoSQL 프레임워크와 호환되는 실용적인 솔루션을 제공하는 데 목적을 두며.
  • 히스토그램 병합 중에 사용자가 지정한 최대 오차 한계를 버킷 크기와 범위 쿼리에 대해 보장하는 데 목적을 두며.
  • 사전에 계산된 데이터 파artitions의 부분 히스토그램에서 동적으로 온디맨드로 히스토그램을 생성할 수 있도록 하는 데 목적을 두며.
  • 오차가 일관되고 제한되어 있음을 보장하는 등 기존의 샘플링 기반 방법을 향상시키는 데 목적을 두며.

제안 방법

  • 매핑-레듀스 작업을 사용하여 정렬과 버킷화를 통해 오프라인으로 각 데이터 파artition에 대해 정확한 등분포 히스토그램을 생성한다.
  • 다양한 파artitions에서 온 $T$-버킷 부분 히스토그램을 새로운 병합 알고리즘을 사용하여 단일 $\beta$-버킷 등분포 히스토그램으로 병합한다.
  • 병합 과정은 수학적 분석에서 유도된 이론적 최대 오차 한계 $2\beta/T$를 버킷 크기와 임의의 범위 쿼리에 대해 보장한다.
  • 원시 데이터를 재처리하지 않고 사전 계산된 히스토그램을 조합하여 임의의 파artitions 조합에 대해 온디맨드 히스토그램 생성을 지원한다.
  • 부분 히스토그램을 증분적으로 저장하고 검색할 수 있는 히스토그램 처리 프레임워크를 사용하여 효율적인 업데이트와 쿼리가 가능하다.
  • 로그 및 트랜잭션 데이터의 증분적 성격을 활용하여 매일 또는 매시간 사전 계산을 수행함으로써 빠른 응답 시간을 확보한다.

실험 결과

연구 질문

  • RQ1사전에 계산된 데이터 파artitions의 부분 히스토그램만을 사용하여 대용량 데이터에 대해 오차가 보장되는 정확한 등분포 히스토그램을 구축할 수 있는가?
  • RQ2정확한 부분 히스토그램의 병합 방식은 튜플 수준의 무작위 샘플링 대비 오차 일관성과 정밀도에서 어떻게 비교되는가?
  • RQ3서브히스토그램 수인 $T$의 파라미터가 병합된 히스토그램의 오차 한계와 성능에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 비균형 데이터를 포함한 다양한 데이터 분포에서도 일정한 오차를 유지할 수 있는가?
  • RQ5실세계 워크로드에서 온라인 샘플링 대비 오프라인 사전 계산 비용은 시간과 확장성 측면에서 어떻게 비교되는가?

주요 결과

  • 실세계 데이터에서 제안된 머지 기반 방법은 그림 16a에 나타나 있듯이 튜플 수준 샘플링 대비 최소 10배 이상 낮은 경계 오차를 달성한다.
  • 머지 방법의 평균 버킷 오차 ($\mu_b$)는 $T$가 증가함에 따라 항상 감소하거나 일정하게 유지되어 안정성과 예측 가능성을 보여준다.
  • 튜플 수준 샘플링 방법은 오차 행동이 일관되지 않으며, $T$가 증가함에 따라 $\mu_b$가 감소하지 않아 신뢰성이 떨어짐을 나타낸다.
  • 머지 방법의 오프라인 요약 처리 시간은 실세계 데이터 기준으로 일일 약 12분이며, 샘플링은 약 4분이지만, 머지 방법은 오차가 제한됨을 보장한다.
  • 실세계 데이터에서 매일 요약을 병합하는 데 걸리는 실행 시간은 샘플링과 유사하며, 머지 방법은 실세계 데이터에서 117초, 비균형 데이터에서 73초가 소요된다(표 II).
  • 프레임워크는 임의의 파artitions 조합에 대해 빠른 온디맨드 히스토그램 생성을 가능하게 하여 클라우드 및 대용량 데이터 시스템에서 실시간 분석에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.