Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Approximate Query Processing

Moritz Kulessa, Alejandro Molina|arXiv (Cornell University)|Nov 15, 2018
Advanced Database Systems and Queries参考文献 18被引用数 10
ひとこと要約

この論文は、生成モデル—特に和積ネットワーク(SPNs)—を用いて、インタラクティブなデータ探索における高速かつ高精度なクエリ推定を実現する、新しいアプローチであるモデルベース近似クエリ処理(AQP)を提案する。従来のAQP手法が事前サンプリングまたはオンラインサンプリングに依存するのに対し、モデルベースAQPは学習段階で完全なデータベースの同時確率分布を学習するため、稀なサブポピュレーションを含む任意のアドホッククエリに対しても、サブ秒未塔の応答時間で高品質な近似を可能にする。

ABSTRACT

Interactive visualizations are arguably the most important tool to explore, understand and convey facts about data. In the past years, the database community has been working on different techniques for Approximate Query Processing (AQP) that aim to deliver an approximate query result given a fixed time bound to support interactive visualizations better. However, classical AQP approaches suffer from various problems that limit the applicability to support the ad-hoc exploration of a new data set: (1) Classical AQP approaches that perform online sampling can support ad-hoc exploration queries but yield low quality if executed over rare subpopulations. (2) Classical AQP approaches that rely on offline sampling can use some form of biased sampling to mitigate these problems but require a priori knowledge of the workload, which is often not realistic if users want to explore a new database. In this paper, we present a new approach to AQP called Model-based AQP that leverages generative models learned over the complete database to answer SQL queries at interactive speeds. Different from classical AQP approaches, generative models allow us to compute responses to ad-hoc queries and deliver high-quality estimates also over rare subpopulations at the same time. In our experiments with real and synthetic data sets, we show that Model-based AQP can in many scenarios return more accurate results in a shorter runtime. Furthermore, we think that our techniques of using generative models presented in this paper can not only be used for AQP in databases but also has applications for other database problems including Query Optimization as well as Data Cleaning.

研究の動機と目的

  • 新しいデータベース上でアドホックでインタラクティブなデータ探索をサポートする従来の近似クエリ処理(AQP)の限界を克服すること。
  • オンラインサンプリングが稀なサブポピュレーションで性能が著しく低下する問題と、オフラインサンプリング手法のワークロード依存性を解消すること。
  • クエリワークロードの事前知識が不要な、高品質で低遅延のクエリ近似を可能にすること。
  • 生成モデル、特に和積ネットワーク(SPNs)を、スケーラブルで高精度なAQPの基盤として活用することの検討。
  • 結合やネストされたサブクエリを含む複雑なクエリに対しても、正確性とパフォーマンスを維持したままAQPの能力を拡張すること。

提案手法

  • 前処理段階で和積ネットワーク(SPNs)を用いて、全データベースの同時確率分布を学習する。
  • 学習されたSPNを用いて、サンプリングを一切行わずに、単純な集計クエリ(例:COUNT、AVG)の確率推定を直接計算する。
  • 複雑なクエリに対しては、SPNからオンザフライで層別サンプリングを生成し、稀なサブポピュレーションのカバレッジを保証する。
  • モデルが学習した分布からのサンプリングにより、ユーザー定義関数や複雑なSQL構文をサポートする。
  • クエリ時に個別のSPNをテーブルごとに組み合わせることで、結合やネストされたクエリの結果を近似する。
  • 不確実性を定量化するための信頼区間推定を採用する。

実験結果

リサーチクエスチョン

  • RQ1生成モデル(例:SPNs)は、アドホッククエリに対して、従来のAQP手法よりも正確で高速なクエリ近似を提供できるか?
  • RQ2従来のオンラインサンプリングが失敗するような稀なサブポピュレーションを対象としたクエリにおいても、モデルベースAQPは高い正確性を維持できるか?
  • RQ3従来のAQP技術と比較して、モデルベースAQPの実行時間はデータサイズにどのようにスケーリングするか?
  • RQ4SPNsは、結合やネストされたサブクエリを含む複雑なクエリを効果的に近似できるか?
  • RQ5SPNモデルの品質がAQP結果の正確性に与える影響は何か?また、ハイブリッドモデルは性能向上に寄与するか?

主な発見

  • モデルベースAQPは、実データおよび合成データの両方において、特に稀なサブポピュレーションを対象としたクエリにおいて、従来のAQPアプローチを上回る高い正確性を達成した。
  • モデルベースAQPの実行時間は主にSPNのサイズに依存し、データサイズとは無関係であるため、大規模データベースでもサブ秒未塔の応答が可能である。
  • この手法はオンザフライで層別サンプリングを効果的に生成でき、従来のオンラインサンプリングが失敗する稀なサブポピュレーションに対しても信頼性の高い推定を実現した。
  • SPNsは単純な集計の直接確率推定と、複雑なクエリのためのサンプル生成を可能にし、幅広いSQL操作をサポートした。
  • 信頼区間推定をサポートしており、ユーザーが近似結果の信頼性を評価できる。
  • 予備的な結果から、モデルと元のデータを組み合わせたハイブリッドSPNsは、強い属性相関を保持することで、さらに正確性を向上させられると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。