Skip to main content
QUICK REVIEW

[論文レビュー] Indexes for Jumbled Pattern Matching in Strings, Trees and Graphs

Ferdinando Cicalese, Travis Gagie|arXiv (Cornell University)|Apr 19, 2013
Algorithms and Data Compression参考文献 6被引用数 5
ひとこと要約

本稿では、文字列、木、グラフにおけるばらばらパターン照合のための効率的なインデックス構造を提示し、マルチセットクエリに対する高速な近似または正確な一致を可能にしている。2色の木に対してO(n)空間のインデックスを導入し、(1+ε)要因内での近似一致をO(|M|)時間でサポートする。これは、実用的なクエリパフォーマンスを維持しながら、空間を顕著に削減している。

ABSTRACT

We consider how to index strings, trees and graphs for jumbled pattern matching when we are asked to return a match if one exists. For example, we show how, given a tree containing two colours, we can build a quadratic-space index with which we can find a match in time proportional to the size of the match. We also show how we need only linear space if we are content with approximate matches.

研究の動機と目的

  • クエリが色のマルチセット(パリック・ベクトル)である文字列、木、グラフにおける、空間効率的なインデックスの設計。
  • 木やパスのような構造化されたデータにおける、正確な一致と近似一致の両方の高速な応答時間を実現すること。
  • 正確な一致のためのO(n²)空間複雑度をO(n)に削減しながら、近似一致のための部分線形クエリ時間の維持。
  • スパニングツリー分解を用いて、二値文字列に関する既存の結果を木およびグラフへ一般化すること。
  • 階層的サンプリングと対数スケーリングを用いて、特に大規模なマルチセットにおいて、空間とクエリ時間のトレードオフを提供すること。

提案手法

  • サイズが2の累乗であるか、白ノード数が(1+ε)倍に増加する点でのみ、代表的な連結部分グラフを格納するO(n)-空間データ構造を構築。これにより、すべての関連する部分グラフタイプのカバレッジが保証される。
  • 線形空間表現(補題3)を用い、各部分グラフをO(w)空間に格納することで、サイズmの部分グラフをO(m)時間で再構築可能にする。
  • 与えられたマルチセットMに対して、サイズ|M|における白ノード数の最小値と最大値を満たす最も近い部分グラフ(H_minとH_max)を、サンプリングされた部分グラフから取得し、(1+ε)要因内での近似を保証する。
  • 連結性を維持しながら、サンプリングされた部分グラフ(H_minおよびH_max)をサイズ|M|に拡張または短縮することで、近似一致を構築する。
  • 木構造を活用し、ノードの追加・削除時に部分グラフが連結のままであることを保証し、O(|M|)の再構築時間の維持を図る。
  • 色の頻度に対数スケーリングを適用することで、格納する部分グラフの数を削減し、最悪ケースでO(n log n)の総サイズを達成するが、部分グラフ表現に関する重要な補題により、O(n)に最適化する。

実験結果

リサーチクエスチョン

  • RQ12色の木におけるばらばらパターン照合のためのO(n)-空間インデックスを設計可能か? また、(1+ε)要因内での近似一致をO(|M|)時間でサポートできるか?
  • RQ2既存のO(n²)-空間インデックスの空間複雑度を、正確なばらばらパターン照合のための木においてO(n)に削減可能か? ただし、効率的なクエリ時間は維持する。
  • RQ3スパニングツリーと階層的サンプリングを用いて、効率的なインデックス技法を二値文字列から木およびグラフへ一般化可能か?
  • RQ4色付き木におけるばらばらパターン照合において、空間、クエリ時間、近似品質の間のトレードオフは何か?
  • RQ5正確な一致が保証されない場合でも、O(n)空間のみで大規模なマルチセットに対して部分線形クエリ時間を達成可能か?

主な発見

  • 2色の木に対して、(1+ε)要因内での各色頻度がターゲットマルチセットMと近似されるような、O(|M|)時間のクエリをサポートするO(n)-空間インデックスを構築可能である。
  • 空間複雑度は、2の累乗のサイズおよび白ノード数が(1+ε)倍に増加する点でのみ部分グラフをサンプリングすることで、O(n²)からO(n)に削減され、格納する部分グラフ数の対数的増加が保証される。
  • 部分グラフの合計サイズはO(n)である。これは、補題3が部分グラフのコンパクト表現と、サイズmの部分グラフをO(m)時間で効率的に再構築可能であることを保証するためである。
  • 直接サンプリングされていないサイズ|M|のマルチセットに対しては、H_minおよびH_maxを最も近いサンプリング済み部分グラフを拡張または短縮することで構築し、(1+ε)要因内での近似を保証する。
  • クエリアルゴリズムは、(1+ε)要因内に近似一致が存在する場合に正しくその一致を特定し、存在しない場合は何も返さない。クエリ時間はO(|M|)である。
  • 本手法はスパニングツリーを用いてグラフへ一般化可能であり、完全版論文では一般グラフへの結果の部分的拡張が行われている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。