Skip to main content
QUICK REVIEW

[論文レビュー] Aggregations over Generalized Hypertree Decompositions

Manas Joglekar, Rohan Puttagunta|arXiv (Cornell University)|Aug 30, 2015
Data Management and Algorithms参考文献 29被引用数 14
ひとこと要約

本稿では、一般化ハイパートリー分解(GHD)を用いてアノテートされた関係における集約-ジョインクエリを最適化するフレームワークを導入する。標準的なジョインアルゴリズムを複数の集約演算子に対応させる。集約順序とGHDの間の単純な同値性および適合性のテストを提供し、最適なクエリ処理を可能にするとともに、実行時間の上限を改善し、効率的なMapReduce実装を実現し、すべてのペアの最短経路問題などにおいてほぼ最適なパフォーマンスを達成する。

ABSTRACT

We study a class of aggregate-join queries with multiple aggregation operators evaluated over annotated relations. We show that straightforward extensions of standard multiway join algorithms and generalized hypertree decompositions (GHDs) provide best-known runtime guarantees. In contrast, prior work uses bespoke algorithms and data structures and does not match these guarantees. Our extensions to the standard techniques are a pair of simple tests that (1) determine if two orderings of aggregation operators are equivalent and (2) determine if a GHD is compatible with a given ordering. These tests provide a means to find an optimal GHD that, when provided to standard join algorithms, will correctly answer a given aggregate-join query. The second class of our contributions is a pair of complete characterizations of (1) the set of orderings equivalent to a given ordering and (2) the set of GHDs compatible with some equivalent ordering. We show by example that previous approaches are incomplete. The key technical consequence of our characterizations is a decomposition of a compatible GHD into a set of (smaller) {\em unconstrained} GHDs, i.e. into a set of GHDs of sub-queries without aggregations. Since this decomposition is comprised of unconstrained GHDs, we are able to connect to the wide literature on GHDs for join query processing, thereby obtaining improved runtime bounds, MapReduce variants, and an efficient method to find approximately optimal GHDs.

研究の動機と目的

  • 複数の集約演算子を含む集約-ジョインクエリのための一般的でスケーラブルな最適化手法の不足に対処すること。
  • 従来の特化されたアルゴリズムに制限があるのを克服し、同等の集約順序と適合するGHDの完全な特徴付けを提供すること。
  • 適合するGHDを非制約的な部分クエリに分解することで、標準的なGHD技術を集約クエリに適用可能にする。
  • すべてのペアの最短経路やトランジティブクラージャーを含む複雑なクエリに、改善された実行時間の上限と効率的な並列(MapReduce)アルゴリズムを導出すること。
  • Ajarクエリを用いて、古典的クエリ処理、線形代数、確率的推論を統一的なフレームワークで統合すること。

提案手法

  • 演算子の可換性および属性の独立性に基づき、2つの集約順序が意味的に同値であるかどうかを判断する単純なテストを導入する。
  • 特定の集約順序をサポートする一般化ハイパートリー分解(GHD)が適合するかどうかを確認する適合性テストを開発する。
  • 適合するGHDを、集約のない部分クエリの非制約的GHDに分解する手法を提案し、既存のGHD理論の再利用を可能にする。
  • AGMバウンドとDBP幅を用いて分数的ハイパートリー幅のバウンドを導出し、MapReduceにおける実行時間と通信量の複雑さを改善する。
  • 鎖状および木構造の構造に対して再帰的なGHD構築を適用し、並列実行における幅と通信コストを最小化する。
  • GHD内の構造的対称性を活用して直列実行を最適化し、各レベルで1つのバッグのみを訪問し、同一の部分木間で結果を複製する。

実験結果

リサーチクエスチョン

  • RQ1異なる集約演算子の順序が同じクエリ結果を生成するための条件は何か?
  • RQ2特定の集約順序と適合する一般化ハイパートリー分解(GHD)の集合を形式的に特徴付けるにはどうすればよいか?
  • RQ3標準的なGHD技術を複数の集約演算子を含むクエリに拡張できるか。その場合、どのような条件下で可能になるか?
  • RQ4すべてのペアの最短経路問題などの基本的問題にこれらの技術を適用した場合、得られる実行時間および通信量の複雑さの上限は何か?
  • RQ5適合するGHDを非制約的サブクエリに分解することで、最適化と並列実行の改善にどのように活用できるか?

主な発見

  • 本稿では、同等の集約順序の完全かつ単純な特徴付けを提供し、演算子が可換であるか、またはクエリ本体において属性が独立している場合に同値性が成立することを示している。
  • ある同等の順序と適合するGHDの完全な特徴付けを確立し、最適な分解の体系的探索を可能にしている。
  • 適合するGHDを非制約的サブクエリに分解することで、既存のGHD理論の適用が可能になり、改善された実行時間保証が得られる。
  • すべてのペアの最短経路問題では、総通信コストが Õ(V³) で、O(log²V) ラウンドのMapReduceアルゴリズムを達成し、特化されたアルゴリズムと比較して多項式対数要因の範囲内でほぼ最適なパフォーマンスを実現している。
  • 鎖状GHDと O(k* log k*) ラウンドを用いることで、総通信コストは Õ(EV) にまで低下し、この問題クラスにおいてほぼ最適性が達成されている。
  • 対称性最適化により、GHDの各レベルで1つのバッグのみを訪問する直列アルゴリズムを実現し、同じ Õ(V³) の複雑さを達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。