Skip to main content
QUICK REVIEW

[논문 리뷰] Right-to-left online construction of parameterized position heaps

Noriki Fujisato, Yuto Nakashima|arXiv (Cornell University)|2018. 08. 03.
Algorithms and Data Compression인용 수 4
한 줄 요약

이 논문은 매개변수화된 위치 히프(RL p-position heaps)에 대한 오른쪽에서 왼쪽으로의 온라인 구축 알고리즘을 제안하며, 매개변수화된 문자열에 대한 효율적인 색인 및 패턴 매칭을 가능하게 한다. 이 방법은 O(n log(σ+π)) 시간에 O(n) 공간을 사용하여 데이터 구조를 구축하며, 매개변수화된 패턴 매칭 쿼리는 O(m log(σ+π) + mπ + pocc) 시간에 처리한다. 이는 기존의 왼쪽에서 오른쪽으로의 접근 방식과 동일한 효율성을 유지하면서도 역방향 처리 워크플로우를 가능하게 한다.

ABSTRACT

Two strings of equal length are said to parameterized match if there is a bijection that maps the characters of one string to those of the other string, so that two strings become identical. The parameterized pattern matching problem is, given two strings $T$ and $P$, to find the occurrences of substrings in $T$ that parameterized match $P$. Diptarama et al. [Position Heaps for Parameterized Strings, CPM 2017] proposed an indexing data structure called parameterized position heaps, and gave a left-to-right online construction algorithm. In this paper, we present a right-to-left online construction algorithm for parameterized position heaps. For a text string $T$ of length $n$ over two kinds of alphabets $Σ$ and $Π$ of respective size $σ$ and $π$, our construction algorithm runs in $O(n \log(σ+ π))$ time with $O(n)$ space. Our right-to-left parameterized position heaps support pattern matching queries in $O(m \log (σ+ π) + m π+ \mathit{pocc}))$ time, where $m$ is the length of a query pattern $P$ and $\mathit{pocc}$ is the number of occurrences to report. Our construction and pattern matching algorithms are as efficient as Diptarama et al.'s algorithms.

연구 동기 및 목표

  • 기존의 왼쪽에서 오른쪽으로의 접근 방식을 보완하는 매개변수화된 위치 히프에 대한 오른쪽에서 왼쪽으로의 온라인 구축 알고리즘을 개발하는 것.
  • 기존 방법과 동일한 시간 및 공간 복잡도를 유지하면서도 텍스트의 끝에서부터 점진적으로 구축할 수 있도록 하는 것.
  • 구축된 구조에서 최대 도달 포인터를 사용하여 효율적인 매개변수화된 패턴 매칭 쿼리를 지원하는 것.
  • 표준 및 매개변수화된 두 종류의 알파벳을 가진 매개변수화된 문자열 매칭에 위치 히프 데이터 구조의 적용 범위를 넓히는 것.

제안 방법

  • 표준 위치 히프에 대한 Ehrenfeucht 등의 오른쪽에서 왼쪽으로의 구축 방법을, 반전된 접미사 링크를 사용하여 매개변수화된 환경에 적응시킨다.
  • 시작 인덱스의 내림차순으로 접미사를 처리함으로써, 위너 유형의 알고리즘을 사용해 RL p-position 히프를 점진적으로 구축한다.
  • 구축 과정 중 최대 도달 포인터를 효율적으로 계산하기 위해 정방향 접미사 링크(반전된 접미사 링크의 역순)를 활용한다.
  • 반전된 접미사 링크에 대한 레이블링 체계를 도입하여 올바른 구조 유지와 로그 시간 복잡도의 간선 탐색을 가능하게 한다.
  • 최종 구조에 최대 도달 포인터를 추가하여 효율적인 패턴 매칭 쿼리를 지원한다.
  • 총 노드 방문 수가 O(n)이 되도록 보장하는 접미사 링크 탐색 전략을 사용하며, 각 방문은 간선 검색에 O(log(σ+π)) 시간이 소요된다.

실험 결과

연구 질문

  • RQ1기존의 왼쪽에서 오른쪽으로의 방법과 동등한 효율성을 가지며, 오른쪽에서 왼쪽으로의 온라인 구축 알고리즘을 매개변수화된 위치 히프에 설계할 수 있는가?
  • RQ2역순으로 매개변수화된 위치 히프를 구축할 때 정확성과 효율성을 유지하기 위해 필요한 레이블링 및 연결 전략은 무엇인가?
  • RQ3오른쪽에서 왼쪽으로의 구축 과정 중 최대 도달 포인터 구조를 점진적으로 유지하여 빠른 매개변수화된 패턴 매칭을 가능하게 할 수 있는가?
  • RQ4매개변수화된 문자열에 대해 RL p-position 히프의 구축 시간을 O(n log(σ+π))로, 공간 복잡도를 O(n)으로 달성할 수 있는가?
  • RQ5최종적으로 생성된 데이터 구조가 기존 솔루션과 비교하여 유사한 시간 복잡도로 매개변수화된 패턴 매칭을 지원할 수 있는가?

주요 결과

  • 제안된 오른쪽에서 왼쪽으로의 구축 알고리즘은 크기가 σ와 π인 알파벳을 사용하는 길이 n인 텍스트 문자열에 대해 O(n log(σ+π)) 시간과 O(n) 공간을 소비한다.
  • 이 구축 과정은 Diptarama 등의 왼쪽에서 오른쪽으로의 알고리즘과 동일한 시간 복잡도를 유지하므로, 효율성의 균형을 확보한다.
  • 결과로 생성된 RL p-position 히프는 m(패턴 길이)과 pocc(보고된 발생 수)에 대해 O(m log(σ+π) + mπ + pocc) 시간 내에 매개변수화된 패턴 매칭 쿼리를 처리할 수 있다.
  • 정방향 접미사 링크와 반전된 접미사 링크에 대한 레이블링 체계의 조합을 통해 점진적인 구축이 효율적으로 가능해진다.
  • 최대 도달 포인터 계산이 구축 과정에 통합되어 총 O(n log(σ+π)) 시간 내에 정확성과 효율성이 보장된다.
  • 미래 작업에서 제안한 바와 같이, 이 방법은 다수의 매개변수화된 문자열에 대한 트라이 기반 색인화에 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.