Skip to main content
QUICK REVIEW

[論文レビュー] Online Pattern Matching for String Edit Distance with Moves

Yoshimasa Takabatake, Yasuo Tabei|arXiv (Cornell University)|Aug 3, 2014
Algorithms and Data Compression参考文献 18被引用数 4
ひとこと要約

本稿では、ストリーミングテキストをリアルタイムで処理できる、移動を含む近似文字列編集距離(EDM)のオンラインアルゴリズムであるオンライン編集感受性パースィング(OESP)を提案する。POUDS(後行順単一次数列)を用いた簡潔なパース木表現と、オンラインL1距離計算のための特徴ベクトルを構築することで、OESPはEDMに対してO(lg²N)近似を達成し、部分線形空間とほぼ線形時間計算量を実現し、大規模ストリーミングデータにおける効率的なパターンマッチングを可能にする。

ABSTRACT

Edit distance with moves (EDM) is a string-to-string distance measure that includes substring moves in addition to ordinal editing operations to turn one string to the other. Although optimizing EDM is intractable, it has many applications especially in error detections. Edit sensitive parsing (ESP) is an efficient parsing algorithm that guarantees an upper bound of parsing discrepancies between different appearances of the same substrings in a string. ESP can be used for computing an approximate EDM as the L1 distance between characteristic vectors built by node labels in parsing trees. However, ESP is not applicable to a streaming text data where a whole text is unknown in advance. We present an online ESP (OESP) that enables an online pattern matching for EDM. OESP builds a parse tree for a streaming text and computes the L1 distance between characteristic vectors in an online manner. For the space-efficient computation of EDM, OESP directly encodes the parse tree into a succinct representation by leveraging the idea behind recent results of a dynamic succinct tree. We experimentally test OESP on the ability to compute EDM in an online manner on benchmark datasets, and we show OESP's efficiency.

研究の動機と目的

  • 全文字列が事前に不明なストリーミングテキスト上で編集距離と移動(EDM)を計算する課題に対処すること。
  • オフラインの編集感受性パースィング(ESP)をオンライン環境に拡張し、ウェブマイニングやバイオインフォマティクスなどの応用分野におけるリアルタイムパターンマッチングを可能にすること。
  • オンラインストリーミング環境においてEDMの正確な近似比を保証しつつ、メモリ使用量を最小限に抑えること。
  • 動的パースィングと即時の距離計算を効率的に行える簡潔なデータ構造を設計すること。

提案手法

  • OESPは、オフラインESPに類似した左寄せパースィング戦略を用いて、ストリーミングテキストのパース木を段階的に構築する。
  • パース木内のノードラベルの特徴ベクトルを維持し、クエリと部分文字列間のL1距離をオンラインで計算する。
  • 後行順走査と単一符号化を用いてパース木を圧縮する、新規の簡潔な木表現である後行順単一次数列(POUDS)を導入する。
  • 動的簡潔木技術とオンライン文法圧縮を活用し、空間効率的で段階的な更新を可能にする。
  • オンラインパースプロセスにおける時間と空間の効率のバランスをとるために、パrameter α を用いたパラメータ化ハッシュテーブルを用いる。
  • アルゴリズムは、部分文字列とクエリ文字列の特徴ベクトル間のL1距離をリアルタイムに計算し、オンラインパターンマッチングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1全テキストが事前に入手できないオンラインストリーミング環境において、移動を含む編集距離(EDM)を効率的に近似できるか?
  • RQ2動的パースィングのための簡潔なデータ構造を維持するオンラインアルゴリズムのEDMに対する近似比は何か?
  • RQ3パース木をリアルタイムで段階的に構築し、圧縮して、低メモリオーバーヘッドでオンラインパターンマッチングを可能にするにはどうすればよいか?
  • RQ4オフラインESPで用いられる特徴ベクトル手法を、保証された境界を伴うオンライン計算に適応できるか?

主な発見

  • OESPは、正確なEDMの保証された近似であるO(lg²N)-近似比を達成する。
  • アルゴリズムの実行時間は期待値でO(N lgN lg n / (α lg lg n))であり、入力サイズに対してほぼ線形のスケーラビリティを示す。
  • 空間計算量はO(n(α+1) lg(n+σ) + n lg(αn) + 5n + o(n))ビットであり、nが文法内の変数数であることを考慮すると、テキスト長に対して部分線形依存であることが示された。
  • 200MBのDNAおよび英語テキストストリームを用いた実験では、OESPの作業メモリ使用量がテキスト長に比例して増加し、ハッシュテーブルに比べて辞書とビットストリング表現が顕著に小さくなった。
  • DNAデータでは辞書の使用量が115MB、英語データでは121MBであったのに対し、ハッシュテーブルはそれぞれ368MBおよび382MBを消費し、空間効率が確認された。
  • 図6は、特定のEDM閾値を超えると部分文字列の数が急激に増加することを示しており、OESPがストリーミングデータにおける類似パターンの同定に実用的であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。