Skip to main content
QUICK REVIEW

[論文レビュー] Exact Analysis of Pattern Matching Algorithms with Probabilistic Arithmetic Automata

Tobias Marschall, Sven Rahmann|arXiv (Cornell University)|Sep 30, 2010
Algorithms and Data Compression参考文献 18被引用数 3
ひとこと要約

本稿では、i.i.d.、マルコフ、HMMを含む任意のランダムテキストモデル下で、窓ベースのパターンマッチングアルゴリズム(Horspool、BDM、BOM)の文字アクセス回数の正確な分布を計算するための一般枠組みを提示する。この枠組みは、確率的算術オートマトン(PAAs)を用い、決定的算術オートマトン(DAAs)を構築・最小化することで、非漸近的かつ正確な性能解析を可能にする。これにより、特定のパターンにおけるアルゴリズムの動作の正確なコスト分布と比較統計が得られる。

ABSTRACT

We propose a framework for the exact probabilistic analysis of window-based pattern matching algorithms, such as Boyer-Moore, Horspool, Backward DAWG Matching, Backward Oracle Matching, and more. In particular, we show how to efficiently obtain the distribution of such an algorithm's running time cost for any given pattern in a random text model, which can be quite general, from simple uniform models to higher-order Markov models or hidden Markov models (HMMs). Furthermore, we provide a technique to compute the exact distribution of \emph{differences} in running time cost of two algorithms. In contrast to previous work, our approach is neither limited to simple text models, nor to asymptotic statements, nor to moment computations such as expectation and variance. Methodically, we use extensions of finite automata which we call deterministic arithmetic automata (DAAs) and probabilistic arithmetic automata (PAAs) [13]. To our knowledge, this is the first time that substring- or suffix-based pattern matching algorithms are analyzed exactly. Experimentally, we compare Horspool's algorithm, Backward DAWG Matching, and Backward Oracle Matching on prototypical patterns of short length and provide statistics on the size of minimal DAAs for these computations.

研究の動機と目的

  • 従来の漸近的解析やモーメントに限定された研究の限界を克服し、窓ベースのパターンマッチングアルゴリズムに対する正確で非漸近的な確率的解析を提供すること。
  • 単純な一様モデルに限定されず、i.i.d.、高階マルコフ、および隠れマルコフモデルを含む一般のテキストモデルにおける解析を可能にすること。
  • 期待値や分散だけでなく、任意のパターンについて、文字アクセスコストの正確な分布を計算する枠組みの開発。
  • 2つのアルゴリズムのコスト差の正確な分布を計算することで、パターン固有の性能評価を可能にする。

提案手法

  • 与えられたパターンと窓状態に対して、パターンマッチングアルゴリズムのコスト(例:文字アクセス回数)をモデル化する決定的算術オートマトン(DAAs)を構築する。
  • DFA最小化技術を適応してDAAsを最小化し、状態空間を削減し、計算効率を向上させる。
  • テキストモデルの確率を組み込むことでDAAsを確率的算術オートマトン(PAAs)に拡張し、有限長のテキスト長における正確な分布計算を可能にする。
  • 2つのアルゴリズム間のコスト差をモデル化する差分DAAsを製品構成により構築し、直接的な比較を可能にする。
  • 短いパターンに対して、Horspool、B(N)DM、BOMアルゴリズムをさまざまなテキストモデルで適用する。
  • 実際のパターンに対して実装・評価を行い、DAAのサイズと計算時間を性能指標として測定する。

実験結果

リサーチクエスチョン

  • RQ1一般のテキストモデル下で、有限長のランダムテキストに対して、与えられたパターンマッチングアルゴリズムの文字アクセスコストの正確な分布は何か?
  • RQ2特定のパターンにおいて、Horspool、B(N)DM、BOMの性能分布はどのように比較できるか。相対的効率に影響を与える要因は何か?
  • RQ32つのアルゴリズム間のコスト差の正確な分布を計算できるか。その結果から得られる相対的動作に関する洞察は何か?
  • RQ4DAA最小化は、より長いパターンにおける状態空間の削減と計算可能性の向上にどの程度寄与するか?
  • RQ5最小DAAサイズはパターン長に対して多項式的に増加するか。過去の構成と比較してどうか?

主な発見

  • この枠組みにより、期待値や分散といったモーメントにとどまらず、窓ベースのパターンマッチングアルゴリズムの文字アクセスコストの完全な分布を正確に計算できるようになった。
  • {A,C,G,T} 上の長さ6のパターンに対して、最小DAAsの平均状態数は、B(N)DMで42.8、BOMで41.8、Horspoolで22であり、最小化による顕著な状態空間削減が確認された。
  • 個々のコスト分布の計算には1パターンあたり0.3〜0.6秒、コスト差の計算には14〜36秒を要した。実用的な実装可能性が裏付けられた。
  • BOMは常にB(N)DMより悪いシフトをとるが、特定のパターン(例:CAAAAA)では48.2%の確率でB(N)DMを上回る性能を示す。これは窓の内容に起因する。
  • 最小DAAサイズはパターン長に対して多項式的に増加する傾向にあり、実用的なパターン長へのスケーラビリティが期待できる。
  • DAA構築の簡潔さと最小化効率の両面で、先行するカンファレンス版を上回り、より長いパターンの解析が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。