Skip to main content
QUICK REVIEW

[論文レビュー] Equi-depth Histogram Construction for Big Data with Quality Guarantees

Burak Yildiz, Tolga Büyüktanır|arXiv (Cornell University)|Jun 17, 2016
Cloud Computing and Resource Management参考文献 27被引用数 6
ひとこと要約

本稿では、データパーティションからの事前計算済みの正確なヒストグラムを用いて、大規模データ上で近似等深さヒストグラムを構築する、新しいマージベースの手法を提案する。この手法は、バケットサイズおよび範囲クエリにおいて最大 $2\beta/T$ の誤差が保証される。このアプローチにより、Hadoop上で理論的かつ実験的保証の下に正確性を確保しつつ、タプルレベルのサンプリングよりも一貫性と精度に優れ、わずかなオフライン計算コストで効率的なオンデマンドヒストグラム構築が可能となる。

ABSTRACT

The amount of data generated and stored in cloud systems has been increasing exponentially. The examples of data include user generated data, machine generated data as well as data crawled from the Internet. There have been several frameworks with proven efficiency to store and process the petabyte scale data such as Apache Hadoop, HDFS and several NoSQL frameworks. These systems have been widely used in industry and thus are subject to several research. The proposed data processing techniques should be compatible with the above frameworks in order to be practical. One of the key data operations is deriving equi-depth histograms as they are crucial in understanding the statistical properties of the underlying data with many applications including query optimization. In this paper, we focus on approximate equi-depth histogram construction for big data and propose a novel merge based histogram construction method with a histogram processing framework which constructs an equi-depth histogram for a given time interval. The proposed method constructs approximate equi-depth histograms by merging exact equi-depth histograms of partitioned data by guaranteeing a maximum error bound on the number of items in a bucket (bucket size) as well as any range on the histogram.

研究の動機と目的

  • リアルタイム分析における大規模で分散されたデータセット向けに、正確な等深さヒストグラムを構築する課題に対処すること。
  • スケーラブルな大規模データ処理向けに、HadoopおよびNoSQLフレームワークと互換性のある実用的ソリューションを提供すること。
  • ヒストグラムのマージ中に、バケットサイズおよび範囲クエリにおけるユーザー指定最大誤差境界を保証すること。
  • 事前計算済みのデータパーティションの部分ヒストグラムから、動的かつオンデマンドでヒストグラムを構築できること。
  • 変動するデータパーティションにわたる一貫性と有界誤差を保証する点で、従来のサンプリングベースの手法を改善すること。

提案手法

  • マップリダスジョブを用いて、各データパーティションに対してソートとバケティングを伴うオフライン処理により、正確な等深さヒストグラムを構築する。
  • 複数のパーティションからの $T$ バケット部分ヒストグラムを、新しいマージアルゴリズムを用いて単一の $\beta$ バケット等深さヒストグラムにマージする。
  • マージ処理は、数学的解析から導かれる理論的最大誤差境界 $2\beta/T$ をバケットサイズおよび任意の範囲クエリにおいて保証する。
  • 生データを再処理することなく、事前計算済みのヒストグラムを組み合わせることで、任意のパーティションサブセット向けにオンデマンドでヒストグラム生成を可能にする。
  • 部分ヒストグラムを段階的に格納・取得できるヒストグラム処理フレームワークを用い、効率的な更新とクエリを実現する。
  • ログや取引データのインクリメンタルな性質を活用し、毎日または毎時あたりの事前計算を可能にし、迅速な応答時間を実現する。

実験結果

リサーチクエスチョン

  • RQ1データパーティションの事前計算済み部分ヒストグラムのみを用いて、大規模データ向けに誤差境界を保証する正確な等深さヒストグラムを構築できるか?
  • RQ2正確な部分ヒストグラムのマージは、タプルレベルのランダムサンプリングと比較して、誤差の一貫性と正確性においてどのように異なるか?
  • RQ3パラメータ $T$(部分ヒストグラムの数)が、マージされたヒストグラムの誤差境界およびパフォーマンスに与える影響は何か?
  • RQ4本手法は、偏りのあるデータを含むさまざまなデータ分布に対しても、有界な誤差を維持できるか?
  • RQ5実世界ワークロードにおける時間的・スケーラビリティの観点から、オフライン事前計算コストとオンラインサンプリングコストを比較するとどうなるか?

主な発見

  • 提案手法のマージベースのアプローチは、実世界データにおいて図16aに示すように、タプルレベルのサンプリングと比較して境界誤差が少なくとも10倍低い。
  • マージ手法の平均バケット誤差 ($\mu_b$) は、$T$ の増加に伴い一貫して非増加的であり、安定性と予測可能性を示している。
  • タプルレベルのサンプリング手法は誤差行動が一貫しないことが判明し、$T$ の増加に対しても $\mu_b$ が減少しないことから、信頼性が低いことが示された。
  • マージ手法のオフライン要約処理は、実データで1日あたり約12分で実行される一方、サンプリングは約4分であるが、マージ手法は誤差が有界であることを保証する。
  • 日次要約のマージ処理時間はサンプリングと同等であり、実データで117秒、偏りのあるデータで73秒(表II)を要する。
  • このフレームワークにより、任意のパーティションサブセットに対して迅速なオンデマンドヒストグラム構築が可能となり、クラウドおよび大規模データシステムにおけるリアルタイム分析に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。