Skip to main content
QUICK REVIEW

[論文レビュー] Pattern Matching in Trees and Strings

Philip Bille|ArXiv.org|Aug 31, 2007
Algorithms and Data Compression参考文献 40被引用数 8
ひとこと要約

本稿では、XMLデータベースにおけるツリーインクリュージョン問題のための新しいアルゴリズムを提示する。このアルゴリズムは、サブクアドラティック時間計算量と線形空間使用量を達成しており、従来の方法が二次的空間を必要としていたのとは対照的である。高度なデータ構造とワードレベル並列処理を活用することで、メインメモリ内に収まる計算で大規模なXMLデータセットの効率的な照合が可能になる。

ABSTRACT

We study the design of efficient algorithms for combinatorial pattern matching. More concretely, we study algorithms for tree matching, string matching, and string matching in compressed texts.

研究の動機と目的

  • 大規模なXMLデータベースにおけるスケーラビリティを制限する二次的空間を必要とする従来のツリーインクリュージョンアルゴリズムの非効率性を是正すること。
  • 空間計算量を Ω(n_P n_T) から O(n_T) に低減させつつ、時間計算量を改善する手法を開発すること。
  • 時間と空間の両方の使用を最適化することで、大規模XMLワークロードにおける効率的なパターンマッチングを可能にすること。
  • 圧縮テキストおよび正規表現マッチングへのツリーマッチングアルゴリズムの適用範囲を拡大し、改善された計算量の境界を提供すること。
  • 最適なリソース使用量を実現するための統一フレームワークを提供すること。

提案手法

  • ツリー走査中にアクティブなオートマトン状態の集合を維持する新しいデータ構造を導入し、効率的なパス部分列検出を可能にする。
  • Ziv-Lempel (ZL) 辞書に基づく圧縮方式を用いて、ツリー内のパスを表現することで、空間使用量を削減しながら照合効率を保持する。
  • 状態集合をビットストリングとして符号化し、ビット並列演算を用いたワードレベル並列処理により、1回の遷移の時間計算量を O(⌈m/log n⌉) に削減する。
  • コンパクトな状態集合符号化を用いたトマプソンオートマトンを活用し、明示的なDFA構築を回避することで、前処理のオーバーヘッドを低減する。
  • 複数の状態からのマッチ集合をマージし、重複を排除するために優先度キューを用いることで、正しいかつ効率的な出力報告を保証する。
  • 2段階の状態集合遷移メカニズムを設計する:まず、最近接の圧縮要素を介して伝搬を行い、次に距離の上限を用いて局所的なパス遷移を適用する。

実験結果

リサーチクエスチョン

  • RQ1従来のアルゴリズムが Ω(n_P n_T) の空間を要するのに対し、ツリーインクリュージョン問題をサブクアドラティック時間と線形空間で解くことは可能か?
  • RQ2空間使用量を増加させることなく、ワードレベル並列処理を活用して、ツリーおよび文字列パターンマッチングにおける時間計算量を低減することは可能か?
  • RQ3ZL78/ZLW などの圧縮テキスト表現を用いることで、正規表現マッチングおよび文字列マッチングの時間的・空間的計算量にどのような影響を与えるか?
  • RQ4ラベル付きツリーにおけるパス部分列問題は、XML照合ワークロードに適した改善された時間的・空間的計算量で効率的に解けるか?
  • RQ5ビット並列演算と階層的圧縮を用いることで、オートマトンの状態集合遷移はどの程度最適化可能か?

主な発見

  • ツリーインクリュージョン問題は、O(n_T) の空間とサブクアドラティック時間、具体的には O(min(l_P n_T, n_P l_T log log n_T + n_T, n_P n_T / log n_T + n_T log n_T)) 時間で解かれる。これは、従来の Ω(n_P n_T) の空間境界を改善したものである。
  • 従来の方法と比較して線形要因の空間削減を達成することで、より大きなXMLデータベースがメインメモリ内に効率的に照合可能になる。
  • 正規表現マッチングにおいて、m > w のとき、時間計算量は O(n m log w / w + m log w) に達し、O(m) の空間制約下で既知の時間境界を改善する。
  • w ≥ log²n のとき、空間使用量にかかわらず、すべての既知の時間境界が改善され、広範な適用可能性を示している。
  • ワードレベル並列処理と圧縮された状態集合符号化を活用することで、ZL78/ZLW 圧縮テキストでは時間計算量をおおよそ log u の要因で低減できる。
  • パス部分列問題は、O(n_T) の空間で、改善された時間計算量で解かれる。これにより、大規模なスケールでのXMLパス照合処理が効率的に行える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。