Skip to main content
QUICK REVIEW

[論文レビュー] Finger Search, Random Access, and Longest Common Extensions in Grammar-Compressed Strings.

Philip Bille, Anders Roy Christiansen|arXiv (Cornell University)|Jul 10, 2015
Algorithms and Data Compression参考文献 33被引用数 3
ひとこと要約

本稿では、文法圧縮された文字列における効率的なフィンガーサーチ、ランダムアクセス、および最長共通接頭部(LCE)クエリを可能にする、新しい文法に基づくデータ構造を提案する。文法に対する新しいvan Emde Boasスタイルの分解を活用することで、部分線形なフィンガーサーチ時間、部分線形な空間コストで定数時間のランダムアクセス、そして効率的なLCEクエリを実現し、すべてのケースにおいて従来の境界を顕著に改善する。

ABSTRACT

Grammar-based compression, where one replaces a long string by a small context-free grammar that generates the string, is a simple and powerful paradigm that captures many popular compression schemes. In this paper, we present new representations of grammars that supports efficient finger search style access, random access, and longest common extensions queries. Let $S$ be a string of length $N$ compressed into a context-free grammar $\mathcal{S}$ of size $n$. We present the following. - An $O(n)$ space representation that supports setting a finger at any position $f$ in $O(\log N)$ time, and subsequently supporting access to any position $i$ in time $O(\log |f - i|)$. - An $O(N^\epsilon n^{1-\epsilon})$ space representation that supports random access to any position in constant time. - Two representations that support longest common extensions queries in either $O(N^{\frac{1}{2}+\epsilon} n^{\frac{1}{2}-\epsilon})$ space and $O(1)$ time or $O(n)$ space and $O(\log N + \log^2 \ell)$ time where $\ell$ is the length of the longest common extension. All of the above bounds significantly improve the currently best known results. To achieve the bounds we introduce several new data structural techniques of independent interest, including a new van Emde Boas style decomposition for grammars.

研究の動機と目的

  • 文法圧縮された文字列へのアクセスおよび比較に適した効率的なデータ構造の設計。
  • フィンガーポジションからの距離に依存する時間計算量でのフィンガーサーチのサポート。
  • 部分線形な空間コストで定数時間のランダムアクセスを実現する。
  • 時間的・空間的トレードオフを改善した最長共通接頭部クエリのサポート。
  • 文法圧縮を越えて応用可能な、新たなデータ構造的技術の導入。

提案手法

  • 文法圧縮のための新しいvan Emde Boasスタイルの分解を導入し、階層的アクセスと分解を可能にする。
  • 任意のフィンガーポジション $f$ からのフィンガーサーチを $O(\log |f - i|)$ 時間で実現する $O(n)$ 空間の表現を設計する。
  • 任意の位置への定数時間ランダムアクセスを実現する $O(N^\epsilon n^{1-\epsilon})$ 空間の表現を構築する。
  • LCEクエリのための2つの代替表現を構築する:1つは $O(N^{\frac{1}{2}+\epsilon} n^{\frac{1}{2}-\epsilon})$ 空間と $O(1)$ クエリ時間、もう1つは $O(n)$ 空間と $O(\log N + \log^2 \ell)$ クエリ時間。
  • パースツリー上の効率的なランクおよびセレクト操作を、文法の階層的構造を活用して実現する。
  • パスラベル圧縮と文法から導かれる木構造上の範囲クエリを適用し、アクセスおよび拡張操作の高速化を図る。

実験結果

リサーチクエスチョン

  • RQ1文法圧縮された文字列におけるフィンガーサーチを、フィンガーポジションからの距離に対し対数的時間で高速化できるか?
  • RQ2部分線形な空間コストで、文法圧縮された文字列において定数時間のランダムアクセスを達成できるか?
  • RQ3部分線形な空間コストで、最長共通接頭部クエリを定数時間でサポートできるか?
  • RQ4文法圧縮された文字列の階層的性質を活用する新たなデータ構造的技術をどのように開発できるか?
  • RQ5van Emde Boasスタイルの分解を文脈自由文法に適応させ、効率的な文字列操作を実現できるか?

主な発見

  • 本稿では、$O(n)$ 空間のみで、任意のフィンガーポジション $f$ からの $O(\log |f - i|)$ フィンガーサーチ時間を達成し、従来の結果を改善した。
  • $O(N^\epsilon n^{1-\epsilon})$ 空間と $O(1)$ クエリ時間のランダムアクセス構造を提示し、空間と時間のトレードオフを顕著に改善した。
  • 2つのLCEクエリ構造を導入した:1つは $O(N^{\frac{1}{2}+\epsilon} n^{\frac{1}{2}-\epsilon})$ 空間と $O(1)$ クエリ時間、もう1つは $O(n)$ 空間と $O(\log N + \log^2 \ell)$ クエリ時間。
  • 提案された文法向けのvan Emde Boasスタイルの分解により、効率的な階層的ナビゲーションが可能となり、改善された計算量境界の実現が可能になった。
  • 提案されたすべてのデータ構造は、文法圧縮された文字列における各操作について、既存の最良の時間的・空間的計算量を顕著に上回っている。
  • 導入された技術は独立した価値を持ち、他の圧縮データ構造への応用も可能性を秘めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。