Skip to main content
QUICK REVIEW

[論文レビュー] OLA-RAW: Scalable Exploration over Raw Data

Yu Cheng, Weijie Zhao|arXiv (Cornell University)|Feb 1, 2017
Advanced Database Systems and Queries参考文献 36被引用数 3
ひとこと要約

OLA-RAW は、データ再編成を必要とせず、生データ上で並列オンライン集計を高速かつ正確に行うクエリ駆動型の二段階サンプリング方式を導入する。クエリ実行中にメモリ上に保持されるサンプル要約を段階的に構築することで、I/OおよびCPUコストを低減し、外部テーブルやチャンクレベルのサンプリングと比較して最大10倍の性能向上を達成するとともに、無関心なクエリに対して正確な早期終了を保証する。

ABSTRACT

In-situ processing has been proposed as a novel data exploration solution in many domains generating massive amounts of raw data, e.g., astronomy, since it provides immediate SQL querying over raw files. The performance of in-situ processing across a query workload is, however, limited by the speed of full scan, tokenizing, and parsing of the entire data. Online aggregation (OLA) has been introduced as an efficient method for data exploration that identifies uninteresting patterns faster by continuously estimating the result of a computation during the actual processing---the computation can be stopped as early as the estimate is accurate enough to be deemed uninteresting. However, existing OLA solutions have a high upfront cost of randomly shuffling and/or sampling the data. In this paper, we present OLA-RAW, a bi-level sampling scheme for parallel online aggregation over raw data. Sampling in OLA-RAW is query-driven and performed exclusively in-situ during the runtime query execution, without data reorganization. This is realized by a novel resource-aware bi-level sampling algorithm that processes data in random chunks concurrently and determines adaptively the number of sampled tuples inside a chunk. In order to avoid the cost of repetitive conversion from raw data, OLA-RAW builds and maintains a memory-resident bi-level sample synopsis incrementally. We implement OLA-RAW inside a modern in-situ data processing system and evaluate its performance across several real and synthetic datasets and file formats. Our results show that OLA-RAW chooses the sampling plan that minimizes the execution time and guarantees the required accuracy for each query in a given workload. The end result is a focused data exploration process that avoids unnecessary work and discards uninteresting data.

研究の動機と目的

  • 従来のイン・サイトデータ処理における非効率性、すなわち無関心なクエリに対してもフルスキャンを要し、I/OおよびCPUコストが高くなる問題に対処すること。
  • 既存のオンライン集計(OLA)システムが、クエリ実行前にデータシャッフルまたはサンプリングを要するため、高い初期コストを負うという制限を克服すること。
  • データ再編成なしに実行時中に正確で信頼区間を伴う集計推定を提供することで、無関心なクエリの早期終了を可能にすること。
  • 生データファイルから直接、段階的に二段階サンプル要約を維持する、スケーラブルで並列処理可能なオンライン集計フレームワークを設計すること。
  • ワークロード内の各クエリに対して必要な正確性を保証しつつ実行時間を最小限に抑えること。特に、有望なデータに焦点を当てた探索を重視すること。

提案手法

  • OLA-RAW は、クエリ実行中に並列にランダムなチャンクでデータを処理する、新規のリソースに配慮した二段階サンプリングアルゴリズムを採用する。
  • リソースの可用性とクエリ要件に基づいて、各チャンク内でのサンプルタプル数を動的に決定する。
  • 生データフォーマットへの繰り返し変換を回避するため、メモリ上に保持される二段階サンプル要約を段階的に構築・維持する。
  • サンプリングはクエリ実行中にのみイン・サイトで実行され、データ再編成や事前処理の必要がない。
  • インスペクションパラドックスを回避し、集計推定の正確な信頼区間をサポートする二段階ベルヌーイサンプリング戦略を採用する。
  • FITS やその他のフラットファイル形式の生ファイル上で直接SQLクエリを実行できる、現代的なイン・サイトデータ処理システムと統合する。

実験結果

リサーチクエスチョン

  • RQ1データ再編成や事前サンプリングを要しない生データ上のオンライン集計を、スケーラブルかつ効率的に行うことは可能か?
  • RQ2二段階サンプリングをイン・サイトクエリ実行に適応させることで、I/OおよびCPUオーバーヘッドを最小限に抑える方法は何か?
  • RQ3クエリ実行中に段階的に維持されるメモリ上に保持される二段階サンプル要約により、生データフォーマットの繰り返し解析のコストを回避できるか?
  • RQ4従来の外部テーブルやチャンクレベルのサンプリングと比較して、クエリ駆動型イン・サイト二段階サンプリングはどの程度のパフォーマンス向上を達成できるか?
  • RQ5OLA-RAW は、必要な正確性を維持しつつ、どの程度まで無関心なクエリの早期終了を可能にすることができるか?

主な発見

  • OLA-RAW は、実データおよび合成データセットにおいて、外部テーブルやチャンクレベルのサンプリングと比較して、実行時間を最大10倍まで短縮する。
  • 信頼区間を伴う正確な集計推定を達成し、結果が無関心である場合に正しく早期終了を可能にする。
  • 段階的にメモリ上に保持される二段階サンプル要約を維持することで、生フォーマットからの繰り返しデータ変換のコストを回避する。
  • クエリ駆動型のサンプリング戦略により、焦点を当てたデータ探索が可能となり、無関心なデータを早期に除外し、不要な計算を削減する。
  • 高価な事前データシャッフルやサンプリングを排除するため、従来のOLAソリューションを凌駆し、大規模な生データ探索に適している。
  • FITS を含む多様なファイルフォーマットで効果を発揮し、並列クエリ実行環境でも良好にスケーリングする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。