Skip to main content
QUICK REVIEW

[論文レビュー] Cartesian Tree Matching and Indexing

Sung Gwan Park, Amihood Amir|arXiv (Cornell University)|May 22, 2019
Algorithms and Data Compression参考文献 19被引用数 7
ひとこと要約

本稿では、2つの文字列が同一のカルテシアンツリーを生成する場合に一致する、新しい文字列一致パラダイム「カルテシアンツリー一致」を導入する。親距離表現を用いた線形時間アルゴリズムを単一および複数パターン一致に適用し、O(n)のランダム化時間で構築可能なカルテシアンサフィックスツリーという新しいデータ構造を提案。この構造により、ファイナンシャルタイムシリーズ解析などの応用分野で数値文字列パターンの効率的なインデキシングが可能になる。

ABSTRACT

We introduce a new metric of match, called Cartesian tree matching, which means that two strings match if they have the same Cartesian trees. Based on Cartesian tree matching, we define single pattern matching for a text of length n and a pattern of length m, and multiple pattern matching for a text of length n and k patterns of total length m. We present an O(n+m) time algorithm for single pattern matching, and an O((n+m) log k) deterministic time or O(n+m) randomized time algorithm for multiple pattern matching. We also define an index data structure called Cartesian suffix tree, and present an O(n) randomized time algorithm to build the Cartesian suffix tree. Our efficient algorithms for Cartesian tree matching use a representation of the Cartesian tree, called the parent-distance representation.

研究の動機と目的

  • 絶対値ではなく相対値が重要な数値時系列データにおけるパターンマッチングのニーズに対応する。
  • 文字列の正確な一致ではなく、カルテシアンツリーの構造的同型性に基づく新しいマッチング指標「カルテシアンツリー一致」を導入する。
  • この新しい指標に基づく単一および複数パターンマッチングのための効率的アルゴリズムを開発する。
  • 大規模なテキストにおける高速パターン検索を可能にする、新しいインデックス構造「カルテシアンサフィックスツリー」を設計・構築する。
  • 絶対値ではなく相対的極値構造(例:「ヘッド・アンド・ショルダー」)で定義されるパターンが重要なファイナンシャル市場分析などの実用的応用を可能にする。

提案手法

  • 2つの文字列が対応するカルテシアンツリーが同型である場合に一致する、カルテシアンツリー一致を定義する。
  • カルテシアンツリーを効率的かつコンパクトに表現する親距離表現(PDR)を導入し、線形時間での比較を可能にする。
  • PDRを用いて、テキストの部分文字列とパターンのPDRを比較することで、O(n + m)時間の単一パターンマッチングアルゴリズムを設計する。
  • ランダム化アルゴリズムを用いたO(n + m)時間、または決定的アルゴリズムを用いたO((n + m) log k)時間の複数パターンマッチングに拡張する。
  • すべてのサフィックスの親距離表現を準サフィックス集合としてモデル化することで、カルテシアンサフィックスツリーを構築し、ColeとHariharanの線形時間サフィックスツリー構築法が適用可能である条件を満たす。
  • 式1に基づく文字オラクルを活用し、ツリー構築中にPDR要素への定数時間アクセスを可能にし、O(n)の期待時間計算量を保証する。

実験結果

リサーチクエスチョン

  • RQ1相対的極値など、絶対値に依存しない数値文字列内の構造的パターンを捉える新しい文字列マッチング指標を定義できるか?
  • RQ2この新しい指標に基づき、単一および複数パターンマッチングに対してO(n + m)時間の効率的アルゴリズムを設計できるか?
  • RQ3カルテシアンツリー一致に適したサフィックスツリーに類似したインデックス構造を構築できるか?また、その構築が線形時間で可能か?
  • RQ4親距離表現は、実用的な文脈でカルテシアンツリーの比較およびインデキシングを効率的に行うのに有効か?
  • RQ5順序保持マッチングやパrameterizedマッチングといった既存の一般化マッチングモデルと比較して、カルテシアンツリー一致は時系列データにおける意味のあるパターンをどのようによりよく捉えられるか?

主な発見

  • カルテシアンツリー一致は、2つの文字列がカルテシアンツリーとして構造的に同一である場合に一致する、新しいマッチング指標であり、『ヘッド・アンド・ショルダー』のような相対的極値パターンの検出を可能にする。
  • 親距離表現により、カルテシアンツリーの線形時間比較が可能となり、効率的アルゴリズムの基盤が構築される。
  • 単一パターンマッチングに対してO(n + m)時間のアルゴリズムが提示され、ナイーブなアプローチに比べて顕著に高速化される。
  • 複数パターンマッチングでは、O(n + m)のランダム化時間またはO((n + m) log k)の決定的時間の両方を達成し、大規模なパターン集合に対してもスケーラブルである。
  • カルテシアンサフィックスツリーは、効率的なパターン検索を可能にする新しいインデックス構造として導入され、ColeとHariharanのアルゴリズムを用いてO(n)の期待時間で構築可能である。
  • 構築プロセスは、サフィックスの親距離表現を準サフィックス集合としてモデル化することで実現され、線形時間構築に必要な性質を満たしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。