Skip to main content
QUICK REVIEW

[论文解读] Approximation ratio of RePair

Danny Hucke, Artur Jeż|arXiv (Cornell University)|Mar 17, 2017
Algorithms and Data Compression参考文献 13被引用 4
一句话总结

该论文通过使用一组二进制编码字符串,将 RePair 语法压缩器的近似比下界从 Ω(√log n) 提升至 Ω(log n / log log n)。分析表明,RePair 的 SLP 大小随 k(其中 k = Θ(log n))呈二次增长,而最优 SLP 大小仅线性增长于 k,揭示了在某些输入下压缩效率存在显著差距。

ABSTRACT

In a seminal paper of Charikar et al.~on the smallest grammar problem, the authors derive upper and lower bounds on the approximation ratios for several grammar-based compressors. Here we improve the lower bound for the famous {\sf RePair} algorithm from $Ω(\sqrt{\log n})$ to $Ω(\log n/\log\log n)$. The family of words used in our proof is defined over a binary alphabet, while the lower bound from Charikar et al. needs an alphabet of logarithmic size in the length of the provided words.

研究动机与目标

  • 提升已知的 RePair 算法在语法压缩中近似比下界的认知。
  • 构造一组二进制字符串,使得 RePair 的性能在最小可能 SLP 的意义上可被严格证明次优。
  • 缩小 RePair 在最坏情况下的近似比上下界之间的差距。
  • 证明该下界在固定二进制字母表下依然成立,与以往依赖随 n 增长字母表的结果形成对比。

提出的方法

  • 基于长度为 ⌈log k⌉ 的基准字符串 B_⌈log k⌉,构造一组定义在二进制字母表上的字符串 s_k,其构造基于整数的二进制表示。
  • 将 s_k 定义为由 b 分隔的 a-块序列,其中每个 a-块的长度对应于 w_k 前缀构成的二进制数。
  • 通过基于二进制编码的递归非终结符构造,证明 s_k 的最小 SLP 大小为 O(k)。
  • 分析 RePair 在 k−1 轮中的行为,表明由于 b 的稀疏性,RePair 独立处理每个 a-块。
  • 利用二进制前缀的结构,证明 RePair 的起始规则包含 Ω(k² / log k) 个长度为 Θ(log k) 的不同因子。
  • 应用引理 1(因子数量上界),表明任何用于 RePair 起始规则的 SLP 大小必须为 Ω(k² / log k),从而得出最终的近似比。

实验结果

研究问题

  • RQ1RePair 算法在语法压缩中的真实最坏情况近似比是多少?
  • RQ2能否仅使用二进制字母表建立 RePair 的 Ω(log n / log log n) 下界?
  • RQ3RePair 在结构化、高度重复的字符串上的性能与最优 SLP 大小相比如何?
  • RQ4RePair 的贪心最大二元组替换策略是否会导致某些输入下产生次优 SLP?

主要发现

  • 所构造字符串 s_k 的最小 SLP 大小为 O(k),其中 k = Θ(log n)。
  • 由于其起始规则中不同因子的大量繁殖,RePair 为 s_k 生成的 SLP 大小为 Ω(k² / log k)。
  • RePair 在 s_k 上的近似比为 Ω(k / log k),换算为 n 的表达式即为 Ω(log n / log log n)。
  • 即使限制为仅替换最大二元组,该下界依然成立,证实了结果的稳健性。
  • 该构造仅使用了二进制字母表,与以往依赖随 n 增长字母表的下界形成鲜明对比。
  • RePair 的性能与最优 SLP 之间的差距依然显著,因为上界为 O((n / log n)^{2/3})。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。