Skip to main content
QUICK REVIEW

[논문 리뷰] Composite repetition-aware data structures

Djamal Belazzougui, Fabio Cunial|arXiv (Cornell University)|2015. 02. 20.
Algorithms and Data Compression참고 문헌 9인용 수 13
한 줄 요약

이 논문은 런레ング스 압축된 부르스-웨일러 변환(RLBWT), 압축된 방향 무향 단어 그래프(CDAWG), 그리고 LZ77 기반 구성요소를 조합하여 고도로 반복적인 문자열에서 공간 효율성과 빠른 패턴 보고를 달성하는 복합 데이터 구조를 제안한다. 주요 기여는 최대 반복의 오른쪽 확장 수 $e$와 왼쪽 확장 수 $e^\ell$를 사용한 새로운 접미사 트리 표현 방식으로, 이는 $O(m\log\log n)$ 시간 내에 매칭 통계를 계산하고 $O(e + e^\ell)$ 공간으로 일정한 공간 복잡도의 순회를 가능하게 한다.

ABSTRACT

In highly repetitive strings, like collections of genomes from the same species, distinct measures of repetition all grow sublinearly in the length of the text, and indexes targeted to such strings typically depend only on one of these measures. We describe two data structures whose size depends on multiple measures of repetition at once, and that provide competitive tradeoffs between the time for counting and reporting all the exact occurrences of a pattern, and the space taken by the structure. The key component of our constructions is the run-length encoded BWT (RLBWT), which takes space proportional to the number of BWT runs: rather than augmenting RLBWT with suffix array samples, we combine it with data structures from LZ77 indexes, which take space proportional to the number of LZ77 factors, and with the compact directed acyclic word graph (CDAWG), which takes space proportional to the number of extensions of maximal repeats. The combination of CDAWG and RLBWT enables also a new representation of the suffix tree, whose size depends again on the number of extensions of maximal repeats, and that is powerful enough to support matching statistics and constant-space traversal.

연구 동기 및 목표

  • 고도로 반복적인 문자열을 위한 데이터 구조를 설계하여 다중 반복 측정 기준을 동시에 고려함으로써 공간 및 시간 효율성을 향상시키는 것.
  • 유전체 데이터베이스와 같은 반복적인 컬렉션에서 패턴 수세기 및 보고의 공간 및 시간 오버헤드를 줄이는 것.
  • 반복성의 보다 정교한 측정 기준으로서 최대 반복의 오른쪽 확장 수인 $e$를 제안하여 $r$ (BWT 런) 또는 $z$ (LZ77 요소)보다 더 효과적인 반복성 측정 기준을 제공하는 것.
  • RLBWT와 CDAWG에 기반한 복합 구조를 사용하여 접미사 트리의 효율적 연산(예: 매칭 통계 및 일정한 공간 복잡도의 순회)을 가능하게 하는 것.
  • 공간, 패턴 보고 시간, 그리고 접미사 링크 및 와이너 링크와 같은 고급 연산 지원 간의 경쟁 가능한 트레이드오프를 달성하는 것.

제안 방법

  • 런레ング스 압축된 BWT(RLBWT)와 압축된 방향 무향 단어 그래프(CDAWG), 그리고 LZ77 기반 구성요소를 조합하여 복합 색인을 구축하는 것.
  • 접미사 트리의 표현을 튜플 $\mathtt{id}(v) = (v^\prime, |\ell(v)|, i, j)$ 형태로 사용하며, 여기서 $v^\prime$는 CDAWG 노드이고 $[i..j]$는 문자열 레이블 $\ell(v)$의 BWT 간격이다.
  • RLBWT를 사용해 빠른 패턴 수세기 및 간격 쿼리 기능을 제공하고, CDAWG를 통해 최대 반복과 그 확장의 압축된 표현을 제공하는 것.
  • RLBWT에서의 역방향 검색과 $\mathsf{RLBWT}_{\overline{T}}$에서의 역방향 샘플링을 사용해 양방향 문자열 연산을 지원하는 것.
  • BWT 간격의 포함 관계와 BWT 내 역방향 단계를 활용하여 접미사 링크 및 와이너 링크를 실제로 실행하는 것.
  • 간격 경계에 대한 선구자 쿼리를 사용해 일정 시간 내에 $\mathtt{stringDepth}$, $\mathtt{child}$, $\mathtt{firstChild}$를 지원하고, $O(\log\log n)$ 시간 내에 $\mathtt{parent}$ 및 $\mathtt{nextSibling}$를 지원하는 것.

실험 결과

연구 질문

  • RQ1RLBWT, CDAWG, 그리고 LZ77 구성요소를 조합하여 다중 반복 측정 기준에 따라 공간 복잡도가 결정되는 데이터 구조를 얻을 수 있는가?
  • RQ2최대 반복의 오른쪽 확장 수인 $e$는 $r$ (BWT 런) 또는 $z$ (LZ77 요소)보다 압축된 문자열 색인의 반복성 측정에 더 효과적인가?
  • RQ3복합 구조가 $O(e + e^\ell)$ 공간만을 사용하여 효율적인 매칭 통계 계산과 일정한 공간 복잡도의 접미사 트리 순회를 지원할 수 있는가?
  • RQ4RLBWT와 CDAWG의 조합이 기존의 RLBWT와 접미사 배열 샘플링 또는 LZ77 색인보다 더 빠른 패턴 보고를 가능하게 하는가?
  • RQ5복합 구조를 사용해 $O(\log\log n)$ 시간 내에 왼쪽/오른쪽 확장(양방향 문자열 연산)을 수행할 수 있는가?

주요 결과

  • 제안된 데이터 구조는 길이 $m$인 패턴의 $\mathtt{occ}$ 개의 발생을 $O(m(\log\log n + \log z) + \mathtt{pocc}\log^\epsilon z + \mathtt{socc}\log\log n)$ 시간 내에 모두 보고하며, 공간 복잡도는 $O(z + r)$ 단위의 단어이다.
  • 최대 반복의 오른쪽 확장 수 $e$와 왼쪽 확장 수 $e^\ell$를 기반으로 한 새로운 접미사 트리 표현 방식은 $O(e + e^\ell)$ 단위의 단어 공간을 사용한다.
  • 길이 $m$인 패턴에 대한 매칭 통계는 복합 접미사 트리 구조를 사용해 $O(m\log\log n)$ 시간 내에 계산할 수 있다.
  • 복합 구조를 사용해 접미사 트리의 일정한 공간 복잡도 순회를 $O(n\log\log n)$ 시간 내에 지원할 수 있다.
  • 복합 구조를 사용해 $O(e + e^\ell)$ 공간 내에서 왼쪽/오른쪽 확장에 대해 $O\left(\log\log n\right)$ 시간 내에 양방향 색인을 수행할 수 있다.
  • CDAWG와 RLBWT의 조합을 통해 간격 연산과 선구자 쿼리를 활용해 접미사 링크 및 와이너 링크를 효율적으로 구현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.