Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Attribute Selectivity Estimation Using Deep Learning

Shohedul Hasan, Saravanan Thirumuruganathan|arXiv (Cornell University)|Mar 24, 2019
Data Quality and Management参考文献 43被引用数 20
ひとこと要約

本稿では、2つの深層学習ベースのアプローチを提案する。1つは自己教師ありニューラル密度推定を用いた非教師あり学習であり、もう1つはクエリ特徴量と真の選択的ラベルを用いた教師あり学習である。両手法とも、空間的オーバーヘッドが低く、従来のヒストグラムやサンプリング手法に比べて、特に複雑で高基数性または低選択的のクエリにおいて顕著に優れた性能を発揮する。

ABSTRACT

Selectivity estimation - the problem of estimating the result size of queries - is a fundamental problem in databases. Accurate estimation of query selectivity involving multiple correlated attributes is especially challenging. Poor cardinality estimates could result in the selection of bad plans by the query optimizer. We investigate the feasibility of using deep learning based approaches for both point and range queries and propose two complementary approaches. Our first approach considers selectivity as an unsupervised deep density estimation problem. We successfully introduce techniques from neural density estimation for this purpose. The key idea is to decompose the joint distribution into a set of tractable conditional probability distributions such that they satisfy the autoregressive property. Our second approach formulates selectivity estimation as a supervised deep learning problem that predicts the selectivity of a given query. We also introduce and address a number of practical challenges arising when adapting deep learning for relational data. These include query/data featurization, incorporating query workload information in a deep learning framework and the dynamic scenario where both data and workload queries could be updated. Our extensive experiments with a special emphasis on queries with a large number of predicates and/or small result sizes demonstrates that our proposed techniques provide fast and accurate selective estimates with minimal space overhead.

研究の動機と目的

  • 複数の相関する属性が関与する状況におけるデータベースにおける正確な選択的推定の課題に対処すること。
  • 深層学習がリレーショナルデータにおける複雑で非線形的な属性間の相関関係を効果的にモデル化できるかを検証すること。
  • 動的で変化するデータおよびクエリの更新に対応できる、軽量で高速かつスケーラブルな深層学習モデルを設計すること。
  • 関数的依存関係やクエリワークロードのパターンといったドメイン知識を深層学習モデルに統合し、推定精度を向上させること。
  • 高次元で相関する属性と複雑なクエリワークロードを有する実世界のデータセット上で、深層学習モデルの性能を評価すること。

提案手法

  • 自己教師あり深層密度推定問題として選択的推定を定式化し、自己回帰的フローを用いて結合分布を扱いやすい条件付き確率に分解する。
  • 各条件付き分布のパラメータを学習するための1つの深層ニューラルネットワークを採用し、自己回帰的性質を活用して属性間の依存関係をモデル化する。
  • 属性の順序をランダムに複数設定したモデルの混合を導入することで、順序への感受性を低減し、一般化性能を向上させる。
  • 教師あり学習では、クエリログから抽出したクエリ特徴量と真の選択的値を入力として用いた深層学習モデルを構築する。
  • ワンホット符号化およびバイナリ符号化を含むクエリ特徴化技術を用い、実験的検証によりバイナリ符号化が高基数ドメインで優れた性能を示すことを確認した。
  • 関数的依存関係を用いて属性の順序をフィルタリング・ガイドすることで、モデルの精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1深層学習は、リレーショナルデータにおける複雑な多属性相関関係を、選択的推定の文脈で効果的にモデル化できるか?
  • RQ2ニューラル密度推定における自己回帰的構造は、従来のヒストグラムやサンプリング手法に比べ、精度をどのように向上させるか?
  • RQ3クエリログで学習した教師あり深層学習モデルは、高次元の述語を持つ未観測クエリにどの程度一般化できるか?
  • RQ4ワンホット符号化とバイナリ符号化の異なるデータ符号化方式は、高基数属性におけるモデル性能にどのように影響を与えるか?
  • RQ5関数的依存関係などのドメイン知識を統合することで、深層学習ベースの選択的推定器のロバスト性と精度は向上するか?

主な発見

  • 非教師あり深層密度推定アプローチは、自己回帰的フローを用いて結合分布をモデル化することで高い精度を達成し、多属性クエリにおける誤差を低減した。
  • 教師あり深層学習モデルは、選択的が1%未満のクエリに対しても中央値q-errorが2未満に留まり、低選択的ケースにおける優れた一般化性能を示した。
  • IMDBのような高基数データセットでは、属性のバイナリ符号化がワンホット符号化を上回り、特にドメインの基数が数万に達する場合に顕著な性能向上が見られた。
  • 1〜5個のランダムな属性順序を用いた混合モデルが最適な性能を発揮した。これ以上の値は、劣悪な順序の影響を高めるリスクを伴う。
  • 関数的依存関係を用いて属性順序をフィルタリングすることで、推定精度に顕著な向上が見られた。これにより、ドメイン知識の統合が価値を持つことが裏付けられた。
  • q-errorを損失関数として用いた教師ありモデルは、MSEを損失関数とするモデルを著しく上回り、q-errorの直接最適化が実用的結果をもたらすことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。