Skip to main content
QUICK REVIEW

[论文解读] Optimal searching of gapped repeats in a word

Maxime Crochemore, Roman Kolpakov|arXiv (Cornell University)|Sep 3, 2015
Algorithms and Data Compression参考文献 30被引用 6
一句话总结

本文提出了一种最优的 $O(\alpha n)$-时间算法,用于在长度为 $n$ 的字符串中找到所有最大 $\alpha$-间隙重复,优于先前的 $O(\alpha^2 n)$ 界限。关键贡献在于证明了此类重复的数量被限制在 $O(\alpha n)$ 以内,这也意味着最大 $\delta$-子重复(指数在 $[1+\delta, 2)$ 范围内的因子)的数量被限制在 $O(n/\delta)$,相比之前的结果改进了 $\log n$ 因子。

ABSTRACT

Following (Kolpakov et al., 2013; Gawrychowski and Manea, 2015), we continue the study of {\em $α$-gapped repeats} in strings, defined as factors $uvu$ with $|uv|\leq α|u|$. Our main result is the $O(αn)$ bound on the number of {\em maximal} $α$-gapped repeats in a string of length $n$, previously proved to be $O(α^2 n)$ in (Kolpakov et al., 2013). For a closely related notion of maximal $δ$-subrepetition (maximal factors of exponent between $1+δ$ and $2$), our result implies the $O(n/δ)$ bound on their number, which improves the bound of (Kolpakov et al., 2010) by a $\log n$ factor. We also prove an algorithmic time bound $O(αn+S)$ ($S$ size of the output) for computing all maximal $α$-gapped repeats. Our solution, inspired by (Gawrychowski and Manea, 2015), is different from the recently published proof by (Tanimura et al., 2015) of the same bound. Together with our bound on $S$, this implies an $O(αn)$-time algorithm for computing all maximal $α$-gapped repeats.

研究动机与目标

  • 建立字符串长度为 $n$ 时最大 $\alpha$-间隙重复数量的更紧上界。
  • 设计一种最优的 $O(\alpha n)$-时间算法,用于计算所有此类重复。
  • 将最大 $\delta$-子重复(指数在 $[1+\delta, 2)$ 范围内的因子)数量的界从 $O(n \log n / \delta)$ 改进为 $O(n / \delta)$。
  • 将间隙重复的洞察推广到间隙回文,并探讨 $\alpha > 0$ 时 $\alpha$-间隙重复的更广泛猜想。

提出的方法

  • 该算法采用基于将字符串分割为可控长度区间的分治方法。
  • 它应用线性时间过程,在每个区间内查找所有最大 $\alpha$-间隙重复,利用了不同区间的数量被限制在 $O(\sigma^{12\log^2 \log n})$ 的事实(对于常数字母表)。
  • 该方法利用了 $\alpha$-间隙重复的结构性质,特别是其周期性和重叠约束,以避免冗余计算。
  • 它将基于区间的搜索与全局聚合步骤相结合,确保不会遗漏任何重复,同时保持 $O(\alpha n)$ 的时间复杂度。
  • 该证明技术与先前工作不同,特别是与 Tanimura 等人(2015)的工作不同,其依赖于对不同区间类型及其重复内容数量的界。
  • 分析使用了最大 $\alpha$-间隙重复及其包含于长度为 $O(\Delta^{\prime\prime})$ 的区间中的概念,其中 $\Delta^{\prime\prime}$ 是对数有界的。

实验结果

研究问题

  • RQ1长度为 $n$ 的字符串中,最大 $\alpha$-间隙重复的数量最多是多少?
  • RQ2最大 $\delta$-子重复的数量能否比 $O(n \log n / \delta)$ 更紧地界定?
  • RQ3是否存在一种 $O(\alpha n)$-时间算法,用于计算字符串中所有最大 $\alpha$-间隙重复?
  • RQ4该 $\alpha$-间隙重复的界能否推广到 $\alpha \leq 1$ 的情况,包括 $\alpha = 1$ 的情形?
  • RQ5对于常数字母表,$O(n/\delta)$ 的 $\delta$-子重复界是否在渐近意义上是紧的?

主要发现

  • 长度为 $n$ 的字符串中,最大 $\alpha$-间隙重复的数量被限制在 $O(\alpha n)$ 以内,优于先前的 $O(\alpha^2 n)$ 界限。
  • 对于常数字母表上的字符串,存在一种 $O(\alpha n)$-时间算法,可计算所有最大 $\alpha$-间隙重复,该算法渐近最优。
  • 最大 $\delta$-子重复(指数在 $[1+\delta, 2)$ 范围内的因子)的数量被限制在 $O(n / \delta)$ 以内,相比先前结果改进了 $\log n$ 因子。
  • $\alpha$-间隙重复的界可推广至最大 $\alpha$-间隙回文,其数量同样被限制在 $O(\alpha n)$ 以内,且可在 $O\big(\alpha n\big)$ 时间内计算。
  • 本文猜想:对于任意 $\alpha > 0$,长度为 $n$ 的字符串中最大 $\alpha$-间隙重复的数量小于 $\alpha n$,从而推广了“runs 猜想”。
  • 最大 $1$-间隙重复(重叠或相邻的重复)的数量严格小于 $n$,且即使考虑高指数的 runs,该界依然成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。