Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal searching of gapped repeats in a word

Maxime Crochemore, Roman Kolpakov|arXiv (Cornell University)|2015. 09. 03.
Algorithms and Data Compression참고 문헌 30인용 수 6
한 줄 요약

이 논문은 길이 $n$인 문자열에서 모든 최대 $α$-gapped 반복을 찾는 데 최적의 $O(\alpha n)$-시간 알고리즘을 제시한다. 이는 이전의 $O(\alpha^2 n)$ bound를 향상시킨 것이다. 주요 기여는 이러한 반복의 수가 $O(\alpha n)$로 유계임을 증명한 것으로, 이는 또한 $O(n/\delta)$ bound로 최대 $δ$-하위반복의 수를 유도하며, 이는 이전 결과보다 $\log n$ 요소를 향상시킨다.

ABSTRACT

Following (Kolpakov et al., 2013; Gawrychowski and Manea, 2015), we continue the study of {\em $α$-gapped repeats} in strings, defined as factors $uvu$ with $|uv|\leq α|u|$. Our main result is the $O(αn)$ bound on the number of {\em maximal} $α$-gapped repeats in a string of length $n$, previously proved to be $O(α^2 n)$ in (Kolpakov et al., 2013). For a closely related notion of maximal $δ$-subrepetition (maximal factors of exponent between $1+δ$ and $2$), our result implies the $O(n/δ)$ bound on their number, which improves the bound of (Kolpakov et al., 2010) by a $\log n$ factor. We also prove an algorithmic time bound $O(αn+S)$ ($S$ size of the output) for computing all maximal $α$-gapped repeats. Our solution, inspired by (Gawrychowski and Manea, 2015), is different from the recently published proof by (Tanimura et al., 2015) of the same bound. Together with our bound on $S$, this implies an $O(αn)$-time algorithm for computing all maximal $α$-gapped repeats.

연구 동기 및 목표

  • 길이 $n$인 문자열에서 최대 $\alpha$-gapped 반복의 수에 대한 더 날카운 상한을 확립하기 위해.
  • 모든 이러한 반복을 계산하기 위한 최적의 $O(\alpha n)$-시간 알고리즘을 설계하기 위해.
  • 지수 범위 $[1+\delta, 2)$를 가진 요소들인 최대 $δ$-하위반복의 수에 대한 기존의 $O(n \log n / \delta)$ bound를 $O(n / \delta)$로 향상시키기 위해.
  • gapped repeat에서의 통찰을 gapped palindrome으로 일반화하고, $\alpha > 0$에 대해 $α$-gapped 반복에 대한 광범위한 추측을 탐색하기 위해.

제안 방법

  • 알고리즘은 길이가 제어된 간격들로 문자열을 분할하는 방식의 분할정복 접근법을 사용한다.
  • 알파벳 크기가 일정할 경우, 서로 다른 간격의 수가 $O(\sigma^{12\log^2 \log n})$로 유계임을 이용하여, 각 간격 내에서 모든 최대 $α$-gapped 반복을 선형 시간에 찾는 절차를 적용한다.
  • 특히 주기성과 겹침 제약 조건을 고려한 $α$-gapped 반복의 구조적 성질을 활용하여 중복 계산을 방지한다.
  • 간격 기반 탐색과 전역 집계 단계를 결합하여 어떤 반복도 놓치지 않도록 하되, $O(\alpha n)$ 시간 복잡도를 유지한다.
  • 기존 연구와는 다릅니다. 특히 Tanimura 등(2015)의 연구와는 다릅니다. 이는 서로 다른 간격 유형의 수와 그 반복 내용을 유계로 제한하는 데 기반합니다.
  • 분석은 최대 $α$-gapped 반복의 개념과 $\Delta^{\prime\prime}$ 길이의 간격 내에 포함됨을 고려하며, 여기서 $\Delta^{\prime\prime}$ 는 로그로 유계임.

실험 결과

연구 질문

  • RQ1길이 $n$인 문자열에 존재할 수 있는 최대 $α$-gapped 반복의 수는 얼마인가?
  • RQ2최대 $δ$-하위반복의 수는 $O(n \log n / \delta)$보다 더 날카운 상한으로 유계로 둘 수 있는가?
  • RQ3문자열에서 모든 최대 $α$-gapped 반복을 계산하기 위한 $O(\alpha n)$-시간 알고리즘이 존재하는가?
  • RQ4$α$-gapped 반복의 수에 대한 유계는 $α \leq 1$로 확장될 수 있는가, 특히 $α = 1$의 경우를 포함하여?
  • RQ5고정된 알파벳에 대해 $δ$-하위반복에 대한 $O(n/\delta)$ 유계는 점근적으로 날카로운가?

주요 결과

  • 길이 $n$인 문자열에서 최대 $α$-gapped 반복의 수는 $O(\alpha n)$로 유계이며, 이는 이전의 $O(\alpha^2 n)$ 유계를 향상시킨 것이다.
  • 고정된 알파벳에서 문자열의 모든 최대 $α$-gapped 반복을 계산하기 위한 $O(\alpha n)$-시간 알고리즘이 존재하며, 이는 점근적으로 최적이다.
  • 지수 범위 $[1+\delta, 2)$를 가진 최대 $δ$-하위반복의 수는 $O(n / \delta)$로 유계이며, 이는 이전의 유계보다 $\log n$ 요소를 향상시킨 것이다.
  • $α$-gapped 반복의 유계는 최대 $α$-gapped 팰린드롬으로도 확장되며, 이 역시 $O(\alpha n)$로 유계이며 $O(\alpha n)$ 시간 내에 계산 가능하다.
  • 논문은 임의의 $\alpha > 0$에 대해, 길이 $n$인 문자열에서 최대 $α$-gapped 반복의 수는 $\alpha n$ 미만임을 추측한다. 이는 '런 추측'을 일반화한 것이다.
  • 최대 $1$-gapped 반복(중복되거나 인접한 복제본)의 수는 엄밀히 $n$ 미만이며, 이 유계는 고지수를 가진 런을 고려할 때에도 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.