Skip to main content
QUICK REVIEW

[論文レビュー] Optimal searching of gapped repeats in a word

Maxime Crochemore, Roman Kolpakov|arXiv (Cornell University)|Sep 3, 2015
Algorithms and Data Compression参考文献 30被引用数 6
ひとこと要約

この論文は、長さ $n$ の文字列に含まれるすべての最大の $\alpha$-ギャップ付き繰り返しを $O(\alpha n)$ 時間で見つける最適なアルゴリズムを提示する。これは以前の $O(\alpha^2 n)$ の境界を改善したものである。主な貢献は、このような繰り返しの数が $O(\alpha n)$ で抑えられることの証明であり、これはまた $\delta$-部分再帰的要因の数に対する $O(n/\delta)$ の境界を示し、以前の結果よりも $\log n$ 要因改善される。

ABSTRACT

Following (Kolpakov et al., 2013; Gawrychowski and Manea, 2015), we continue the study of {\em $α$-gapped repeats} in strings, defined as factors $uvu$ with $|uv|\leq α|u|$. Our main result is the $O(αn)$ bound on the number of {\em maximal} $α$-gapped repeats in a string of length $n$, previously proved to be $O(α^2 n)$ in (Kolpakov et al., 2013). For a closely related notion of maximal $δ$-subrepetition (maximal factors of exponent between $1+δ$ and $2$), our result implies the $O(n/δ)$ bound on their number, which improves the bound of (Kolpakov et al., 2010) by a $\log n$ factor. We also prove an algorithmic time bound $O(αn+S)$ ($S$ size of the output) for computing all maximal $α$-gapped repeats. Our solution, inspired by (Gawrychowski and Manea, 2015), is different from the recently published proof by (Tanimura et al., 2015) of the same bound. Together with our bound on $S$, this implies an $O(αn)$-time algorithm for computing all maximal $α$-gapped repeats.

研究の動機と目的

  • 長さ $n$ の文字列における最大の $\alpha$-ギャップ付き繰り返しの数に対するより鋭い上界を確立すること。
  • すべてのこのような繰り返しを計算するための最適な $O(\alpha n)$-時間アルゴリズムを設計すること。
  • $\delta$-部分再帰的要因(指数が $[1+\delta, 2)$ の範囲にある要因)の数に対する境界を $O(n \log n / \delta)$ から $O(n / \delta)$ に改善すること。
  • ギャップ付き繰り返しに関する知見をギャップ付き回文へ一般化し、$\alpha > 0$ に対する $\alpha$-ギャップ付き繰り返しに関する広範な予想を検討すること。

提案手法

  • アルゴリズムは、長さが制御された区間への文字列の分割に基づく分割統治的手法を用いる。
  • 各セグメント内でのすべての最大の $\alpha$-ギャップ付き繰り返しを特定する線形時間手順を適用し、これはアルファベットのサイズが定数の場合、異なるセグメントの数が $O(\sigma^{12\log^2 \log n})$ で抑えられることを利用している。
  • 特に周期性と重複制約に着目した $\alpha$-ギャップ付き繰り返しの構造的性質を活用し、重複計算を回避する。
  • セグメントベースの探索と、すべての繰り返しが見逃されないことを保証するグローバル集約ステップを組み合わせ、$O(\alpha n)$ 時間計算量を維持する。
  • 証明技法は、Tanimura ら(2015)の研究とは顕著に異なり、異なるセグメントタイプの数とそれらの繰り返し内容の上限に依存している。
  • 解析では、$\Delta^{\prime\prime}$ が対数的に有界であるような長さ $O(\Delta^{\prime\prime})$ の区間に含まれる最大の $\alpha$-ギャップ付き繰り返しの概念を用いる。

実験結果

リサーチクエスチョン

  • RQ1長さ $n$ の文字列に存在しうる最大の $\alpha$-ギャップ付き繰り返しの数の最大値は何か?
  • RQ2$\delta$-部分再帰的要因の数を $O(n \log n / \delta)$ よりも鋭く境界づけられるか?
  • RQ3長さ $n$ の文字列に含まれるすべての最大の $\alpha$-ギャップ付き繰り返しを計算する $O(\alpha n)$-時間アルゴリズムは存在するか?
  • RQ4この $\alpha$-ギャップ付き繰り返しの境界は $\alpha \leq 1$、特に $\alpha = 1$ の場合にも拡張可能か?
  • RQ5定数アルファベットの場合、$\delta$-部分再帰的要因に対する $O(n/\delta)$ の境界は漸近的にタイトか?

主な発見

  • 長さ $n$ の文字列に含まれる最大の $\alpha$-ギャップ付き繰り返しの数は $O(\alpha n)$ で抑えられ、以前の $O(\alpha^2 n)$ の境界を改善する。
  • 定数アルファベット上でのすべての最大の $\alpha$-ギャップ付き繰り返しを計算する $O(\alpha n)$-時間アルゴリズムが存在し、これは漸近的に最適である。
  • $\delta$-部分再帰的要因(指数が $[1+\delta, 2)$ の範囲にある要因)の数は $O(n / \delta)$ で抑えられ、以前の境界より $\log n$ 要因改善される。
  • $\alpha$-ギャップ付き繰り返しの境界は、最大の $\alpha$-ギャップ付き回文に対しても拡張可能であり、それらの数も $O(\alpha n)$ で抑えられ、$O\big(\alpha n\big)$ 時間で計算可能である。
  • 本稿では、任意の $\alpha > 0$ に対して、長さ $n$ の文字列に含まれる最大の $\alpha$-ギャップ付き繰り返しの数は $\alpha n$ よりも小さいと予想しており、これは「ランズ予想」を一般化するものである。
  • 最大の $1$-ギャップ付き繰り返し(重複するか隣接するコピー)の数は $n$ よりも厳密に小さい。この境界は、高指数のランを含む場合でも成り立つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。