Skip to main content
QUICK REVIEW

[論文レビュー] Workload-Driven Vertical Partitioning for Effective Query Processing over Raw Data

Weijie Zhao, Yu Cheng|arXiv (Cornell University)|Mar 31, 2015
Advanced Database Systems and Queries参考文献 38被引用数 4
ひとこと要約

本稿では、ストレージ制約のもとでクエリ処理時間を最小化するため、作業負荷駆動型の2段階ヒューリスティクスを提案する。部分的ロードを二値垂直パーティショニングとしてモデル化し、線形混合整数計画法(MIP)を用いることで、正確なMIPソルブに比べて大幅に短い時間でほぼ最適な性能を達成する。実世界のCSV、FITS、JSONワークロードを用いた検証により、その有効性が裏付けられている。

ABSTRACT

Traditional databases are not equipped with the adequate functionality to handle the volume and variety of "Big Data". Strict schema definition and data loading are prerequisites even for the most primitive query session. Raw data processing has been proposed as a schema-on-demand alternative that provides instant access to the data. When loading is an option, it is driven exclusively by the current-running query, resulting in sub-optimal performance across a query workload. In this paper, we investigate the problem of workload-driven raw data processing with partial loading. We model loading as fully-replicated binary vertical partitioning. We provide a linear mixed integer programming optimization formulation that we prove to be NP-hard. We design a two-stage heuristic that comes within close range of the optimal solution in a fraction of the time. We extend the optimization formulation and the heuristic to pipelined raw data processing, scenario in which data access and extraction are executed concurrently. We provide three case-studies over real data formats that confirm the accuracy of the model when implemented in a state-of-the-art pipelined operator for raw data processing.

研究の動機と目的

  • 大規模データワークロードにおける従来のスキーマ駆動型データロードの非効率性、すなわち不要な属性が高コストで複製・保存されることを是正すること。
  • 完全なレプリケーションを伴う部分的ロードを二値垂直パーティショニングとしてモデル化し、どの属性をロードするかを最適化可能にする。
  • 正確なパーティショニングを近似するが、計算時間は著しく削減されたスケーラブルな2段階ヒューリスティクスを設計すること。
  • データアクセスと抽出が同時に進行するパイプライン処理における、最適化とヒューリスティクスの拡張を図ること。
  • 最先端のパイプライン演算子を用いて、実世界のデータフォーマット(CSV、FITS、JSON)におけるモデルの正確性とヒューリスティクスの性能を検証すること。

提案手法

  • 部分的ロード問題を線形混合整数計画法(MIP)として定式化し、NP困難かつ近似不能であることを証明する。
  • 2段階ヒューリスティクスを設計:第1段階では、最も多くのクエリを満たす属性を選択してクエリカバレッジを最大化する。第2段階では、使用頻度に基づいて属性を優先順位付けし、パーティショニングを最適化する。
  • パイプライン処理に適応したMIP定式化とヒューリスティクスを設計。データの並列アクセスと抽出によりI/Oバッファを軽減する。
  • 実世界のデータ処理パイプライン演算子として実装し、同時にデータアクセスと属性抽出を可能にする。
  • 実世界のワークロード(例:SDSSカタログにおける100万件のクエリ)を用いて、正確な実行結果との比較による性能と正確性を評価する。
  • BLOBストレージや動的スキーマプロモーションといった既存のRDBMS機能を活用しつつ、重複データの複製を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1作業負荷駆動型の原始データの垂直パーティショニングは、ストレージ予算制約を守りながら、クエリ処理時間を顕著に短縮できるか?
  • RQ2完全なレプリケーションを伴う部分的ロードを、二値垂直パーティショニング問題としてどのようにモデル化できるか?
  • RQ32段階ヒューリスティクスは、正確なMIPソルブに比べて著しく短い時間でほぼ最適な性能を達成できるか?
  • RQ4データアクセスと抽出が同時に進行するパイプライン処理シナリオにおいて、提案モデルはどのように性能を発揮するか?
  • RQ5MIP定式化は、実際のパイプライン処理における原始データ処理演算子の実行特性をどれほど正確に反映しているか?

主な発見

  • 提案された2段階ヒューリスティクスは、正確なMIPソリューションとほぼ同等のクエリ実行時間を達成するが、計算時間は著しく短く、実世界のワークロードに実用的である。
  • MIP定式化がNP困難かつ近似不能であることが証明され、スケーラブルな展開のためのヒューリスティクスの使用が正当化される。
  • SDSSカタログを対象としたケーススタディでは、509属性中74属性しかクエリに使われていなかったが、完全レプリケーションにより膨大なストレージの無駄が生じていた。これは、作業負荷に配慮したロードの重要性を示している。
  • CSV、FITS、JSONといった実データフォーマットにおいて、従来の垂直パーティショニングアルゴリズムに比べ、クエリ処理効率とスケーラビリティの両面で優れた性能を発揮する。
  • パイプライン処理用に拡張した定式化は、並列なデータアクセスと抽出を正確にモデル化し、実世界のシナリオでI/O効率を向上させた。
  • 最先端のパイプライン演算子を用いた検証により、モデルが低レベルの実行詳細を正確に捉えていることが確認され、生産環境での利用に適していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。