Skip to main content
QUICK REVIEW

[論文レビュー] Selectivity Estimation with Deep Likelihood Models

Zongheng Yang, Eric Liang|arXiv (Cornell University)|May 10, 2019
Data Management and Algorithms参考文献 56被引用数 12
ひとこと要約

本稿では、独立性の仮定をせず、複雑な範囲およびワイルドカードクエリを効率的に処理できるように、モンテカルロ積分を用いた深層尤度モデルを、データベースにおける選択性推定に提案する。本手法は、末尾選択性において1桁の乗法的誤差を達成し、最先端の手法と比較して40–200倍の精度向上を達成する一方で、メモリ使用量と実行時間の両面で効率的である。

ABSTRACT

Selectivity estimation has long been grounded in statistical tools for density estimation. To capture the rich multivariate distributions of relational tables, we propose the use of a new type of high-capacity statistical model: deep likelihood models. However, direct application of these models leads to a limited estimator that is prohibitively expensive to evaluate for range and wildcard predicates. To make a truly usable estimator, we develop a Monte Carlo integration scheme on top of likelihood models that can efficiently handle range queries with dozens of filters or more. Like classical synopses, our estimator summarizes the data without supervision. Unlike previous solutions, our estimator approximates the joint data distribution without any independence assumptions. When evaluated on real-world datasets and compared against real systems and dominant families of techniques, our likelihood model based estimator achieves single-digit multiplicative error at tail, a 40-200$ imes$ accuracy improvement over the second best method, and is space- and runtime-efficient.

研究の動機と目的

  • リレーショナルテーブルにおける複雑な多次元データ分布をモデル化する古典的統計的手法の限界を解決すること。
  • 範囲およびワイルドカード述語に直接深層尤度モデルを適用する際の高い計算コストを克服すること。
  • 属性間の独立性を仮定しない、スケーラブルで教師なしの推定器を構築し、同時データ分布を捉えること。
  • 特に末尾選択性領域において高い精度を達成するとともに、メモリ使用量と実行時間の両面で効率的である選択性推定を実現すること。

提案手法

  • リレーショナルデータ内の豊富な多次元分布を捉えるために、高容量な密度推定器として深層尤度モデルを採用する。
  • 深層尤度モデル上のクエリ選択性を効率的に近似するためのモンテカルロ積分スキームを設計する。
  • 明示的な周辺化を避けるために、確率的サンプリングを用いて範囲およびワイルドカード述語を評価し、計算コストを低減する。
  • 独立性の仮定なしに同時分布を要約する、コンactな教師なし要約を維持する。
  • 尤度モデルが属性間の複雑な依存関係を表現できる能力を活用し、推定の正確性を向上させる。
  • 数十個のフィルタにまでスケーラブルなように、統合スキームを最適化する。

実験結果

リサーチクエスチョン

  • RQ1深層尤度モデルの高い計算コストを考慮しても、データベースの選択性推定に効果的に適応可能か?
  • RQ2モンテカルロ積分をどのように活用すれば、深層尤度モデルを範囲およびワイルドカードクエリに実用的にすることができるか?
  • RQ3尤度モデルは、独立性に基づく手法や要約に基づく手法と比較して、どの程度選択性推定の精度を向上させられるか?
  • RQ4本手法は、末尾選択性領域において高い精度を達成しつつ、メモリ使用量と実行時間の両面で効率的であるか?

主な発見

  • 提案手法は、末尾選択性領域において1桁の乗法的誤差を達成し、既存手法を著しく上回る。
  • 2番目に精度の高かった手法と比較して、40–200倍の精度向上を達成し、推定の正確性が著しく向上した。
  • 推定器はメモリ使用量と実行時間の両面で効率的であり、実世界のデータベースシステムへの実用的導入を可能にする。
  • 従来の手法とは異なり、属性間の独立性を仮定せず、複雑なデータ相関を捉える。
  • モンテカルロ積分スキームにより、数十個のフィルタを含むクエリの効率的評価が可能となり、スケーラビリティが確保される。
  • 本手法は教師なしであり、ラベル付き例や学習データを必要とせず、データを要約する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。