Skip to main content
QUICK REVIEW

[論文レビュー] Approximation ratio of RePair

Danny Hucke, Artur Jeż|arXiv (Cornell University)|Mar 17, 2017
Algorithms and Data Compression参考文献 13被引用数 4
ひとこと要約

この論文は、二進符号化された文字列の族を用いて、RePair文法ベース圧縮の近似比の下界を Ω(√log n) から Ω(log n / log log n) に改善した。解析により、RePairのSLPサイズは k(ここで k = Θ(log n)に対して二次的に増加するのに対し、最適なSLPサイズは k に対して線形に増加するため、特定の入力では圧縮効率に顕著な差が生じることが示された。

ABSTRACT

In a seminal paper of Charikar et al.~on the smallest grammar problem, the authors derive upper and lower bounds on the approximation ratios for several grammar-based compressors. Here we improve the lower bound for the famous {\sf RePair} algorithm from $Ω(\sqrt{\log n})$ to $Ω(\log n/\log\log n)$. The family of words used in our proof is defined over a binary alphabet, while the lower bound from Charikar et al. needs an alphabet of logarithmic size in the length of the provided words.

研究の動機と目的

  • 文法ベース圧縮におけるRePairアルゴリズムの近似比の既知の下界を改善すること。
  • RePairの性能が最小のSLPに対して明らかに劣っていることが証明可能な、二進文字列の族を構築すること。
  • RePairの近似比の最悪ケースにおける既知の上界と下界の差を埋めること。
  • 下界が、アルファベットが n に応じて拡大する必要がない固定二進アルファベットでも成り立つことを示すこと、これは先行研究とは対照的である。

提案手法

  • ベース文字列 B_⌈log k⌉ から導出される整数の二進表現を用いて、二進アルファベット上に文字列 s_k の族を構築する。
  • s_k を a ブロックの列とし、それらを b で区切る。各 a ブロックの長さは、w_k の接頭辞から形成される二進数に対応する。
  • 二進符号化に基づく再帰的非終端記号構築により、s_k の最小 SLP サイズが O(k) であることを証明する。
  • RePair が k−1 ラウンドにわたり動作することを分析し、b の希釈性により a ブロックが独立して処理されることを示す。
  • 二進接頭辞の構造を用いて、RePair の開始規則に Ω(k² / log k) 個の長さ Θ(log k) の異なる要因が存在することを確立する。
  • 補題 1(要因数の上限)を適用し、RePair の開始規則の任意の SLP がサイズ Ω(k² / log k) 以上であることを示し、最終的な近似比を得る。

実験結果

リサーチクエスチョン

  • RQ1文法ベース圧縮におけるRePairアルゴリズムの真の最悪ケース近似比は何か?
  • RQ2二進アルファベットのみを用いても、RePair に対して Ω(log n / log log n) の下界を確立できるか?
  • RQ3構造的で高頻度の繰り返しを持つ文字列において、RePair の性能は最適なSLPサイズと比べてどの程度か?
  • RQ4RePair のグリーディな最大二文字列の置換は、特定の入力において劣化したSLPを生成するか?

主な発見

  • 構築された文字列 s_k の最小 SLP サイズは O(k) である。ここで k = Θ(log n) である。
  • RePair は s_k に対して Ω(k² / log k) のサイズの SLP を生成する。これは、開始規則に多数の異なる要因が生じるためである。
  • s_k における RePair の近似比は Ω(k / log k) であり、n を用いて表すと Ω(log n / log log n) に相当する。
  • 下界は、RePair が最大二文字列の置換に制限されても成り立つため、結果の頑健性が確認された。
  • この構成は二進アルファベットのみを用いており、先行研究が n に比例して拡大するアルファベットを必要としていたのとは対照的である。
  • 上界が O((n / log n)^{2/3}) であるのに対し、RePair の性能と最適 SLP の間のギャップは依然として顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。