Skip to main content
QUICK REVIEW

[論文レビュー] Restructuring Compressed Texts without Explicit Decompression

Keisuke Goto, Shirou Maruyama|arXiv (Cornell University)|Jul 14, 2011
Algorithms and Data Compression参考文献 27被引用数 5
ひとこと要約

本稿では、明示的な解凍を伴わずに圧縮テキストを再構成するための最初の多項式時間アルゴリズムを提示する。これにより、LZ77、LZ78、RLE、SLPs、文法ベース形式といったさまざまな圧縮形式間での効率的な変換が可能となり、解凍ベースの手法と比較して理論的な高速化が達成される。主な貢献は、すべての変換が圧縮入力および出力のサイズに関して多項式時間で実行されることであり、解凍を先に実行するアプローチと比較して、最悪ケースにおいて指数的スピードアップを達成している。

ABSTRACT

We consider the problem of {\em restructuring} compressed texts without explicit decompression. We present algorithms which allow conversions from compressed representations of a string $T$ produced by any grammar-based compression algorithm, to representations produced by several specific compression algorithms including LZ77, LZ78, run length encoding, and some grammar based compression algorithms. These are the first algorithms that achieve running times polynomial in the size of the compressed input and output representations of $T$. Since most of the representations we consider can achieve exponential compression, our algorithms are theoretically faster in the worst case, than any algorithm which first decompresses the string for the conversion.

研究の動機と目的

  • 解凍せずに圧縮文字列を処理・変換するフレームワークの開発。従来の解凍ベース手法よりも高速な計算を実現すること。
  • データマイニング、機械学習、圧縮パターンマッチングなどの応用分野における動的かつ柔軟な圧縮テキスト表現のニーズに対応すること。
  • 異なる圧縮表現間の効率的変換を可能にすることで、最適な圧縮形式の後続選択を可能にすること。
  • 編集操作における効率的な更新と再構成を可能にすることで、動的圧縮テキストデータ構造を支援すること。
  • 多様な圧縮形式を統一的な効率的変換フレームワークの下に統合し、圧縮文字列処理の範囲を拡張すること。

提案手法

  • 範囲検索可能な点集合やトライ木といった高度なデータ構造を活用し、圧縮表現内の部分文字列や埋め込みを効率的に特定する。
  • 再帰的な埋め込み技術を用いて、圧縮形式のまま最大繰り返し部分列や部分文字列を同定し、解凍なしに要因分解を可能にする。
  • 証拠に基づくパースィングを採用し、各要因が圧縮部分文字列内の範囲クエリおよび接尾辞-接頭辞照合によって検証される。
  • LZ77およびLZ78への変換では、接尾辞の二分探索と証拠木を用い、各ステップあたり対数時間で次の要因を特定する。
  • RLEからESP、およびESPからバイセクションへの変換では、整数符号化されたランレングスを用いた反復的置換と、対数時間の埋め込みチェックを適用する。
  • 動的範囲クエリとバランスの取れたパースィングを用いて、編集感受性パースィング(ESP)とストレートラインプログラム(SLPs)を統合し、多項式時間の複雑性を保証する。

実験結果

リサーチクエスチョン

  • RQ1圧縮文字列表現を、明示的な解凍を伴わずに、互いに変換可能であり、かつ多項式時間の複雑性を維持できるか。
  • RQ2このような圧縮形式変換が、解凍を先に実行するアプローチと比較して、理論的にどの程度の性能向上を達成できるか。
  • RQ3圧縮文字列に対する動的編集操作を、再構成を通じて効率的にサポートできるか。
  • RQ4圧縮ドメイン内で、最適な圧縮形式の後続選択を効率的に実現できるか。
  • RQ5多様な圧縮形式間での効率的かつ損失なしの変換を可能にするために、最小限のデータ構造とアルゴリズムは何か。

主な発見

  • 本稿では、LZ77、LZ78、RLE、SLPs、文法ベース形式を含む、圧縮表現間の変換を解凍せずに実行する最初のアルゴリズムを提示する。これらのアルゴリズムは、圧縮入力および出力のサイズに関して多項式時間で実行される。
  • サイズ $ n $ の正規化されたSLPをLZ78に変換する時間計算量は $ O(m\log^3 N + n) $ であり、ここで $ m $ はLZ78要因の数、$ N $ は文字列長を表す。
  • RLEから編集感受性パースィング(ESP)への変換は $ O(n\log^* N) $ 時間で実行され、ほぼ線形性能を達成する。
  • ESPからバイセクションSLPsへの変換は $ O(m\log^2 N) $ 時間で実行され、$ m $ は生成されたSLPのサイズを表す。これは、バランスの取れた文法構築を効率的に処理できることを示している。
  • SLPsからのLZ77要因分解には、$ O(m\log^2 n \log^3 N + n\log^2 n) $ 時間がかかる。これは、大きな入力に対してもスケーラブルであることを示している。
  • 提案されたすべてのアルゴリズムは、解凍ベース手法よりも理論的な高速化を達成しており、特に圧縮比が指数的である最悪ケースで顕著な恩恵を受ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。