Skip to main content
QUICK REVIEW

[논문 리뷰] Small-space encoding LCE data structure with constant-time queries

Yuka Tanimura, Takaaki Nishimoto|arXiv (Cornell University)|2017. 02. 24.
Algorithms and Data Compression인용 수 5
한 줄 요약

이 논문은 Lempel-Ziv 77 분해의 크기 z와 τ ≤ √n인 트레이드오프 파라미터를 사용하여 O(1) 쿼리 시간을 달성하는 LCE 문제를 위한 새로운 인코딩 데이터 구조를 제안한다. 이 구조는 O(zτ² + n/τ) 단어의 공간을 사용하며, 사전 처리 후 원본 문자열에 접근할 필요가 없고, 고도로 반복적인 문자열이나 작은 알파벳에 대해 알려진 시간-공간 트레이드오프 하한선을 초월한다.

ABSTRACT

The \emph{longest common extension} (\emph{LCE}) problem is to preprocess a given string $w$ of length $n$ so that the length of the longest common prefix between suffixes of $w$ that start at any two given positions is answered quickly. In this paper, we present a data structure of $O(z τ^2 + \frac{n}τ)$ words of space which answers LCE queries in $O(1)$ time and can be built in $O(n \log σ)$ time, where $1 \leq τ\leq \sqrt{n}$ is a parameter, $z$ is the size of the Lempel-Ziv 77 factorization of $w$ and $σ$ is the alphabet size. This is an \emph{encoding} data structure, i.e., it does not access the input string $w$ when answering queries and thus $w$ can be deleted after preprocessing. On top of this main result, we obtain further results using (variants of) our LCE data structure, which include the following: - For highly repetitive strings where the $zτ^2$ term is dominated by $\frac{n}τ$, we obtain a \emph{constant-time and sub-linear space} LCE query data structure. - Even when the input string is not well compressible via Lempel-Ziv 77 factorization, we still can obtain a \emph{constant-time and sub-linear space} LCE data structure for suitable $τ$ and for $σ\leq 2^{o(\log n)}$. - The time-space trade-off lower bounds for the LCE problem by Bille et al. [J. Discrete Algorithms, 25:42-50, 2014] and by Kosolobov [CoRR, abs/1611.02891, 2016] can be "surpassed" in some cases with our LCE data structure.

연구 동기 및 목표

  • 원본 문자열을 저장할 필요 없이 일정 시간 쿼리를 지원하면서 부분선형 공간을 사용하는 공간 효율적인 LCE 데이터 구조를 설계하는 것.
  • 사전 처리 후 원본 문자열을 저장할 필요 없이 인코딩 데이터 구조를 생성함으로써 원본 문자열 저장 필요성을 제거하는 것.
  • 특정 영역, 예를 들어 고도로 반복적인 문자열이나 작은 알파벳에서 LCE 문제의 기존 시간-공간 트레이드오프 하한선을 초월하는 것.
  • Lempel-Ziv 77 분해로 압축 가능한 문자열에 대해 최적의 공간-시간 트레이드오프를 달성하는 것.
  • Lempel-Ziv 분해를 부분선형 작업 공간으로 계산할 수 있는지 탐색하는 것.

제안 방법

  • 접두사가 길이 t로 잘린 t-트렁케이티드 서피크 트리를 사용하여 데이터 구조를 구축하며, 서피크 트리를 Lempel-Ziv 77 분해를 사용하여 압축한다.
  • 원본 문자열을 저장하지 않는 새로운 인코딩 기법을 도입하여, 압축된 표현과 보조 데이터 구조에만 의존한다.
  • LCP 배열의 범위 최소값 쿼리(RMQ)와 서피크 배열의 압축된 표현을 조합하여 LCE 쿼리를 O(1) 시간에 응답한다.
  • 공간과 시간을 균형 잡기 위해 파라미터 τ를 사용하며, 공간 복잡도는 O(zτ² + n/τ) 단어로 제한된다.
  • 작은 알파벳 크기(σ ≤ 2^o(log n))의 경우, 팩킹된 메모리 워드를 활용하여 길이 log n인 부분 문자열에 대해 일정 시간 비트 병렬 연산을 수행한다.
  • 두 단계 쿼리 메커니즘을 사용한다: 길이가 log n 비트 이하인 짧은 LCE는 비트 병렬 연산으로 처리하고, 긴 LCE는 잘린 서피크 트리에 대한 압축된 RMQ 구조로 처리한다.

실험 결과

연구 질문

  • RQ1원본 문자열에 접근하지 않고도 부분선형 공간을 사용하면서 일정 시간 LCE 데이터 구조를 구축할 수 있는가?
  • RQ2고도로 반복적인 문자열에 대해 실질적으로 알려진 LCE 문제의 시간-공간 하한선을 초월할 수 있는가?
  • RQ3Lempel-Ziv 분해 크기가 작을 때 z인 문자열에 대해 O(n/τ) 공간에서 O(1) 쿼리 시간을 달성할 수 있는가?
  • RQ4알파벳 크기 σ가 LCE 데이터 구조의 시간-공간 트레이드오프 하한선의 타당성에 영향을 미치는가?
  • RQ5Lempel-Ziv 77 분해를 O(n log σ) 시간에 부분선형 작업 공간으로 계산할 수 있는가?

주요 결과

  • 제안된 데이터 구조는 O(zτ² + n/τ) 단어의 공간을 사용하며, O(1) 시간에 LCE 쿼리를 지원한다. 구축 시간은 O(n log σ)이며, 작업 공간은 O(zτ² + n/τ)이다.
  • zτ²이 n/τ에 지배되는 고도로 반복적인 문자열의 경우, 공간 사용량은 부분선형이 되어 O(n/τ) 단어로 O(1) 쿼리 시간을 달성한다.
  • σ ≤ 2^o(log n)일 경우, T(n)S(n) = o(n log n)를 달성하여 Bille 등(2014)의 하한선을 초월한다.
  • σ ≤ 2^o(√log n)일 경우, 시간과 공간 복잡도의 곱은 o(n log n)이 되어 이 영역에서 Kosolobov의 하한선을 초월한다.
  • 이 데이터 구조는 인코딩 구조이다. 사전 처리 후 원본 문자열 w는 삭제될 수 있으며, 쿼리에서는 w에 접근할 필요가 없다.
  • 작은 알파벳 크기에서 팩킹 워드를 이용한 비트 병렬 연산이 길이 log n인 부분 문자열에 대해 일정 시간 LCE 쿼리를 가능하게 하여 효율적인 쿼리 조합을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.