Skip to main content
QUICK REVIEW

[論文レビュー] Approximation of grammar-based compression via recompression

Artur Jeż|arXiv (Cornell University)|Jan 24, 2013
Algorithms and Data Compression参考文献 13被引用数 15
ひとこと要約

本稿では、入力文字列の長さを $N$、最適な文法のサイズを $g$ とすると、サイズが $\mathcal{O}(g\log(N/g))$ であるような文法を線形時間で構築する単純なアルゴリズムを提示する。この手法は、LZ77 や導出木のバランス化に依存せずに、再圧縮技術を新規に応用することで、最小文法に近い近似比を達成し、アルゴリズムの複雑さを最小限に抑える。

ABSTRACT

In this paper we present a simple linear-time algorithm constructing a context-free grammar of size O(g log(N/g)) for the input string, where N is the size of the input string and g the size of the optimal grammar generating this string. The algorithm works for arbitrary size alphabets, but the running time is linear assuming that the alphabet Σof the input string can be identified with numbers from {1, ..., N^c} for some constant c. Otherwise, additional cost of O(n log|Σ|) is needed. Algorithms with such approximation guarantees and running time are known, the novelty of this paper is a particular simplicity of the algorithm as well as the analysis of the algorithm, which uses a general technique of recompression recently introduced by the author. Furthermore, contrary to the previous results, this work does not use the LZ representation of the input string in the construction, nor in the analysis.

研究の動機と目的

  • 与えられた文字列に対して、最小の文法に近い近似を達成する、単純で効率的な文法ベースの圧縮用アルゴリズムの開発。
  • LZ77 やバランスの取れた木構造に依存せずに、$\mathcal{O}(g\log(N/g))$ の近似比を達成すること。
  • 再圧縮に基づく新しいフレームワークを導入することで、文法圧縮の解析と実装を簡素化すること。
  • アルゴリズムが標準的なアルファベット表現の仮定のもとで線形時間で実行されることを示すこと。

提案手法

  • アルゴリズムは、繰り返し文字のペアを新しい非終端記号に置き換える再圧縮技術を用い、圧縮表現を常に維持する。
  • 新しい非終端記号を導入する際のコストを追跡するマーキングシステムを導入し、将来の操作に十分なクレジットを確保する。
  • 従来の手法とは異なり、LZ77 やバランスの取れた導出木(例:AVL 樹形図や長さバランス木)の明示的使用を避ける。
  • クレジットベースの会計制度を用いて、文法構築の総コストを制限し、最終的な文法サイズが $\mathcal{O}(g\log(N/g))$ の範囲内に収まるように保証する。
  • アルゴリズムは段階を経て文字列を処理し、各段階で現在の表現の長さを段階的に短縮しながら、各段階あたりのコストを有界に保つ。
  • 再圧縮プロセスの性質を用いて、ブロックサイズの対数の和と導入されたブロック数の上限を評価することで、解析を行う。

実験結果

リサーチクエスチョン

  • RQ1従来の手法よりも単純な方法で、線形実行時間と $\mathcal{O}(g\log(N/g))$ の近似比を達成する文法ベースの圧縮アルゴリズムは可能か?
  • RQ2文法圧縮アルゴリズムの構築と解析において、LZ77 やバランスの取れた木構造を避けることは可能か?
  • RQ3再圧縮技術をどのように変形すれば、最小文法問題に対するタイトな近似保証を得られるか?
  • RQ4クレジットベースの会計制度を再圧縮フレームワークに適用した際の、文法サイズにおける最小限のオーバーヘッドは何か?

主な発見

  • 本アルゴリズムは、長さ $N$ の任意の入力文字列に対して、最適文法サイズ $g$ を用いて $\mathcal{O}(g\log(N/g))$ のサイズの文法を構築する。
  • アルファベットが定数 $c$ に対して $\{1,\ldots,N^c\}$ の整数として表現可能であるという仮定のもとで、実行時間は $N$ に対して線形である。
  • アルファベットがこのように数値的に表現可能でない場合、追加コスト $\mathcal{O}(n\log|\Sigma|)$ が必要となる。
  • 本手法は、LZ77 や導出木のバランス化(例:AVL 樹形図や長さバランス木)に依存せず、従来の研究とは明確に異なる。
  • クレジットベースの解析により、新しい非終端記号を導入する総コストが $\mathcal{O}(g + g\log(N/g))$ に有界であることが保証される。
  • 最終的な文法サイズは、最適値に対して $\mathcal{O}(g\log(N/g))$ の範囲内に保証され、再圧縮を用いた一貫性のある統一的解析によって達成される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。