Skip to main content
QUICK REVIEW

[論文レビュー] Aggregate Skyline Join Queries: Skylines with Aggregate Operations over Multiple Relations

Arnab Bhattacharya, B. Palvali Teja|arXiv (Cornell University)|Jun 28, 2012
Data Management and Algorithms参考文献 10被引用数 9
ひとこと要約

本稿では、ローカル属性と集計演算(例:コストの合計、期間)を含む結合関係におけるスカイラインを計算する新しいクエリ型である集計スカイラインジョインクエリ(ASJQ)を紹介する。著者らは、スカイラインを結合の前段階で局所的に処理する3つの効率的なアルゴリズム—MSC、ドミナントベース、反復型—を提案しており、実データおよび合成データセットを用いたスケーラビリティとパフォーマンスにおいて、単純なアプローチを著しく上回っている。

ABSTRACT

The multi-criteria decision making, which is possible with the advent of skyline queries, has been applied in many areas. Though most of the existing research is concerned with only a single relation, several real world applications require finding the skyline set of records over multiple relations. Consequently, the join operation over skylines where the preferences are local to each relation, has been proposed. In many of those cases, however, the join often involves performing aggregate operations among some of the attributes from the different relations. In this paper, we introduce such queries as "aggregate skyline join queries". Since the naive algorithm is impractical, we propose three algorithms to efficiently process such queries. The algorithms utilize certain properties of skyline sets, and processes the skylines as much as possible locally before computing the join. Experiments with real and synthetic datasets exhibit the practicality and scalability of the algorithms with respect to the cardinality and dimensionality of the relations.

研究の動機と目的

  • 複数の関係にまたがるスカイラインクエリにおいて、結合されたタプルの属性を集計する必要に対応すること。
  • ローカルな好みと集計指標の両方を含む結合関係における多基準意思決定を必要とする実世界のシナリオを処理すること。
  • スカイライン選択の前に完全な結合を単純に計算する非現実的なコストを回避する効率的アルゴリズムの設計。
  • 異なるデータ分布、カーディナリティ、次元数の下での提案アルゴリズムのスケーラビリティとパフォーマンスを評価すること。
  • 実バスケットボール選手データセットおよび合成ワークロードを用いて、実用的応用の有効性を示すこと。

提案手法

  • ASJQを処理するための3つのアルゴリズム—MSC(マルチスカイライン計算)、ドミナントベース、反復型—を提案。各関係でスカイラインを局所的に計算し、その後に結合を行う。
  • 反復型アルゴリズムを用いて、結合結果セット内の支配されるタプルを段階的に除外することで、高コストな比較を削減。
  • スカイライン集合の性質を活用し、結合プロセス中の支配チェックの回数を最小限に抑える。
  • 等価結合後に異なる関係からの属性に対して集計演算(合計、最小、最大)を適用し、ユーザー定義の好み関数を保持。
  • 最小化(コスト/期間)と最大化(評価/アメニティ)の混合好みタイプを処理できるようにアルゴリズムを設計。
  • 2段階アプローチを採用:まず各関係で局所スカイラインを計算し、その後に結合に配慮したスカイライン計算を実施。

実験結果

リサーチクエスチョン

  • RQ1結合された属性に集計演算を含む複数関係におけるスカイラインクエリを、どのように効率的に拡張できるか?
  • RQ2スカイライン計算の前に関係を単純に結合する場合の性能ボトルネックは何か。また、それらはどのように緩和できるか?
  • RQ3データ分布(相関、独立、逆相関)、カーディナリティ、次元数が、ASJQ処理のスケーラビリティに与える影響は何か?
  • RQ4MSC、ドミナントベース、反復型のうち、実際の実行において効率性とスケーラビリティのバランスを最も良く果たすのはどのアルゴリズム戦略か?
  • RQ5ジョイン属性のカテゴリ数が、ASJQ結果セットのサイズおよび実行時間に与える影響は何か?

主な発見

  • 反復型アルゴリズムは、特に大規模かつ逆相関データセットにおいて、MSCおよびドミナントベース手法よりも実行時間で優れている。
  • ジョイン属性が使用されない場合(カルテシアン積)、ASJQ結果セットのカーディナリティが最大となり、複数の属性が等価ジョインに使用される場合に最小となる。
  • ジョイン属性のカテゴリ数が増えると、初期スカイライン集合が大きくなるため、実行時間が延びるが、最終的な結合関係のサイズは減少する。
  • 反復型アルゴリズムは次元数およびカーディナリティの増加に対しても優れたスケーラビリティを示し、支配されるタプルを段階的に除外する戦略のおかげ。
  • 逆相関データセットでは、ほぼすべてのタプルがスカイラインに含まれるため、反復型アルゴリズムの段階的除外戦略が顕著なパフォーマンス優位性をもたらす。
  • 実バスケットボールデータセットを用いた実験により、反復型アルゴリズムが最良のパフォーマンスを達成しており、実行時間は結果セットのカーディナリティの傾向を反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。