Skip to main content
QUICK REVIEW

[論文レビュー] Unasssuming View-Size Estimation Techniques in OLAP

Kamel Aouiche, Daniel Lemire|ArXiv.org|Mar 12, 2007
Advanced Database Systems and Queries参考文献 8被引用数 4
ひとこと要約

この論文は、OLAPデータウェアハウスにおける未加工なビュー・サイズ推定技術—Gibbons-Tirthapura、確率的カウント、LogLog、多スケールモデル—を評価する。Gibbons-Tirthapuraは、すべてのビュー・サイズで安定的かつ理論的に境界づけられた推定値を提供するが、確率的カウントは大規模なビューでより正確であり、LogLogは性能が劣り、多スケール手法は最も速いが精度は低いことが示された。

ABSTRACT

Even if storage was infinite, a data warehouse could not materialize all possible views due to the running time and update requirements. Therefore, it is necessary to estimate quickly, accurately, and reliably the size of views. Many available techniques make particular statistical assumptions and their error can be quite large. Unassuming techniques exist, but typically assume we have independent hashing for which there is no known practical implementation. We adapt an unassuming estimator due to Gibbons and Tirthapura: its theoretical bounds do not make unpractical assumptions. We compare this technique experimentally with stochastic probabilistic counting, LogLog probabilistic counting, and multifractal statistical models. Our experiments show that we can reliably and accurately (within 10%, 19 times out 20) estimate view sizes over large data sets (1.5 GB) within minutes, using almost no memory. However, only Gibbons-Tirthapura provides universally tight estimates irrespective of the size of the view. For large views, probabilistic counting has a small edge in accuracy, whereas the competitive sampling-based method (multifractal) we tested is an order of magnitude faster but can sometimes provide poor estimates (relative error of 100%). In our tests, LogLog probabilistic counting is not competitive. Experimental validation on the US Census 1990 data set and on the Transaction Processing Performance (TPC H) data set is provided.

研究の動機と目的

  • OLAPデータウェアハウスにおける未加工なビュー・サイズ推定技術の正確性と性能を評価すること。
  • 実世界のデータウェアハウスワークロード下で、最先端の未加工推定手法—Gibbons-Tirthapura、確率的カウント、LogLog、多スケールモデル—を比較すること。
  • 特に小さなビュー・サイズにおいて、推定誤差の理論的境界が実際の状況でも成り立つかどうかを評価すること。
  • さまざまな推定手法間でのメモリ使用量、速度、正確性のトレードオフを特定すること。
  • 物化ビュー選択ヒューリスティクスにおけるビュー・サイズ推定手法の選定に実証的指針を提供すること。

提案手法

  • 3重独立ハッシュを用いるGibbons-Tirthapura推定器を適応し、理論的保証付きの未加工かつ境界づけられた誤差推定を提供する。
  • 確率的カウントおよびLogLog確率的カウントを実装し、いずれもメモリパラメータMを用いて正確性を制御するハッシュベースの重複数え数え上げに依存する。
  • サンプル統計(重複数F₀、最大頻度m_max、サンプルサイズN′)に基づく多スケールモデルを用い、分布の仮定なしにビュー・サイズを推定する。
  • 標準化されたテストプロトコルを用いる:さまざまな比率(p ∈ {0.1%, 0.3%, 0.5%, 0.7%})でデータをサンプリングし、各手法でビュー・サイズを推定し、推定時間と推定値を記録し、正確なサイズと比較する。
  • 信頼性と理論的境界への適合性を評価するために、20回の実行における95百分位誤差を測定する。
  • 一般化性を確保するため、実データ(1990年米国国勢調査)および合成データ(TPC-H)の両方で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1Gibbons-Tirthapura、確率的カウント、LogLogといった未加工推定手法の理論的誤差境界が、多様なビュー・サイズにわたり実際の状況でも成り立つかどうか。
  • RQ2特に歪度の影響が顕著に現れる小さなビュー・サイズにおいて、各推定手法の正確性はどのように変化するか。
  • RQ3Gibbons-Tirthapura、確率的カウント、LogLog、および多スケールサンプリングに基づく手法の間で、相対的な性能(速度と正確性)のトレードオフはいかなるものか。
  • RQ4多スケールモデルは、統計的仮定を含むものの、フルスキャン推定手法の実用的代替手段として機能できるか。
  • RQ5メモリ使用量(M)が各手法の正確性に与える影響は何か。理論的に予想される1/√Mの正確性スケーリングは、実際の状況でも反映されているか。

主な発見

  • Gibbons-Tirthapuraは、すべてのビュー・サイズで一貫して境界づけられ、安定した推定値を提供し、理論的95百分位誤差境界(19/20の信頼性)が実験的に検証された。
  • 小さなビュー・サイズでは、確率的カウントおよびLogLogが100%を超える相対誤差を示し、重要な状況での信頼性が低いことが判明した。
  • 多スケール推定器は他の手法と比べて約100倍速く、推定を約2秒で完了したが、正確性は低く、粗い推定値を出力した。
  • 確率的カウントはLogLogを上回り、正確性と速度の両面で優れており、理論的利点があるものの、LogLogは推奨されない。
  • 推定時間はストリーミング処理とハッシュ処理に大きく依存しており、Gibbons-Tirthapura、確率的カウント、LogLogは1990年米国国勢調査データセットでそれぞれ約5〜7分を要した。
  • すべての推定器のメモリ使用量は最小限(数MiB)であり、理論的メモリパラメータMにかかわらず、データウェアハウス環境において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。