Skip to main content
QUICK REVIEW

[論文レビュー] Un index de jointure pour les entrepôts de données XML

Hadj Mahboubi, Kamel Aouiche|ArXiv.org|Jul 9, 2007
Advanced Database Systems and Queries参考文献 7被引用数 4
ひとこと要約

本論文では、XMLデータウェアハウスを対象に、XQuery結合演算のパフォーマンスオーバーヘッドを排除することを目的とした新しい結合インデックス構造を提案する。事実表と次元データを1つの最適化されたXMLインデックスに再構成することで、ネイティブXML DBMSにインデックスを適用しない場合と比較して、階層的で多次元的なクエリで最大25,669倍のクエリ実行時間を短縮する。

ABSTRACT

XML data warehouses form an interesting basis for decision-support applications that exploit heterogeneous data from multiple sources. However, XML-native database systems currently bear limited performances and it is necessary to research ways to optimize them. In this paper, we propose a new index that is specifically adapted to the multidimensional architecture of XML warehouses and eliminates join operations, while preserving the information contained in the original warehouse. A theoretical study and experimental results demonstrate the efficiency of our index, even when queries are complex.

研究の動機と目的

  • ネイティブXML DBMSが複雑で複数の結合を含む意思決定支援クエリを処理する際の性能劣化を是正すること。
  • XMLデータウェアハウスの多次元スキーマを保持しつつ、結合処理のコストを排除するインデックス構造を設計すること。
  • 複数のパス式、グループ化、集計を含むXQueryワークロードのクエリ実行を最適化すること。
  • 理論的分析とネイティブXML DBMS(eXist)を用いた実世界の実験を通じて、インデックスの有効性を検証すること。
  • XQuery構文を拡張し、複数のGROUP BY句をサポートすることで、完全なOLAP機能を実現すること。

提案手法

  • 提案されたインデックスは、事実表と次元データを、スター・スキーマに類似した1つのXML構造に再編成する。次元キーと事実値を埋め込んだ属性を含む。
  • インデックス内の各セルには、@idおよび@node属性を持つ次元ノードと、@idおよび@value属性を持つ事実ノードが含まれ、測定値を表す。
  • 深さ優先探索および幅優先探索を用いて次元ノードを走査することで、複数のドキュメントを結合する必要なく、事実値に直接アクセス可能となる。
  • 標準的なXQuery(複数の結合を含む)を、インデックスの階層構造を活用した単一インデックス走査に変換するクエリリライト手法を適用する。
  • 理論的コスト分析により、ネイティブXQuery(結合あり)とインデックス化されたアプローチの実行コストを比較し、複雑さが顕著に低減されることを示す。
  • 実験は、eXistネイティブXML DBMSを用いた実際のXCubeベースのXMLデータウェアハウスで実施され、データサイズを変化させ、インデックス有無での実行時間を測定した。

実験結果

リサーチクエスチョン

  • RQ1特殊なインデックス構造によって、XMLデータウェアハウスのクエリにおける複数結合処理のパフォーマンスペナルティを排除できるか?
  • RQ2複雑で多次元的なXQueryワークロードにおいて、提案されたインデックスはネイティブXML DBMSの実行時間と比べてどの程度優れているか?
  • RQ3インデックスは、XMLウェアハウスの元のデータ意味論と多次元スキーマをどの程度正確に保持しているか?
  • RQ4インデックスは、XQueryにおける多次元のGROUP BYおよび集計処理といった複雑な分析処理をサポートできるか?
  • RQ5データ量とクエリの複雑さが増加するに従い、インデックスのスケーラビリティはどの程度向上するか?

主な発見

  • 理論的分析により、インデックスは実行コストをO(|Cell| * |Dimension| * (|Dimension| + |di| * |ai|))からO(|Cell| * (|Dimension| + |ai|))に低減し、主要な結合コスト要因を排除した。
  • 実験的評価では、インデックスを用いることで、ネイティブXQueryでインデックスなしに処理した場合と比較して、平均して25,669倍のクエリ実行時間短縮が達成された。
  • インデックスを用いることで、4.92 MBの全事実テーブルを2秒未塔で処理できたが、インデックスなしでは合理的な時間内に結果を得ることができなかった。
  • データサイズの変化に関わらず、性能向上は一貫しており、理論的予測と密接に一致した。
  • インデックスは、標準XQueryでネイティブにサポートされていない複数のGROUP BY句を含む複雑なXQueryクエリの実行を成功裏に可能にした。
  • 結果から、インデックスはXMLデータウェアハウスにおける大規模で複雑な意思決定支援ワークロードに対しても有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。