Skip to main content
QUICK REVIEW

[论文解读] Prefix Codes for Power Laws with Countable Support

Michael B. Baer|arXiv (Cornell University)|Nov 15, 2006
Algorithms and Data Compression参考文献 25被引用 4
一句话总结

本文提出了一类针对具有可数支撑的幂律分布的前缀码,特别优化了对 zeta 分布(ζ(2))和 Gauss-Kuzmin 分布的压缩效率。通过利用递归结构和基于二进制表示与完整二叉码的自适应编码,所提出的码实现了接近最优的性能,具备基于熵的严格界,并在性能上优于现有的 Golomb 和 Rice 码等方法。

ABSTRACT

In prefix coding over an infinite alphabet, methods that consider specific distributions generally consider those that decline more quickly than a power law (e.g., Golomb coding). Particular power-law distributions, however, model many random variables encountered in practice. For such random variables, compression performance is judged via estimates of expected bits per input symbol. This correspondence introduces a family of prefix codes with an eye towards near-optimal coding of known distributions. Compression performance is precisely estimated for well-known probability distributions using these codes and using previously known prefix codes. One application of these near-optimal codes is an improved representation of rational numbers.

研究动机与目标

  • 为解决无限字母表源在幂律分布(如 $p(i) \sim i^{-\alpha}$,$\alpha > 1$)下缺乏高效前缀编码方案的问题。
  • 开发一类前缀码家族,实现对已知幂律分布的近似最优压缩性能,尤其针对在连分数展开和词频等实际场景中出现的分布。
  • 使用基于熵的界和递归码构造方法,对这些码的期望码字长度提供精确的分析估计。
  • 通过更高效地编码展开式中的整数系数,改进有理数在连分数表示下的压缩效果。
  • 将前缀编码的应用范围从快速衰减的分布(如几何分布)扩展到在现实世界数据中常见的缓慢衰减幂律分布。

提出的方法

  • 提出一种基于将整数范围划分为大小为 $2^{g_i}$ 的块的递归码构造方法,其中 $g_i = \lfloor \lg i \rfloor$,并在每个块内使用完整二叉码表示偏移量。
  • 定义码族 $c_\omega(i)$,其由长度为 $g_i$ 的不等长前缀和二进制后缀 $b(i - 2^{g_i}, m_i)$ 组成,其中 $m_i = (2^{g_i} - (-1)^{g_i})/3$。
  • 引入基于归一化的熵界,用于估计期望码字长度,其形式为 $\sum p(i)n(i) \geq H_x + (y_x + \lg(1 - \sigma_x))(1 - \sigma_x)$,其中 $\sigma_x = \sum_{i=1}^{x-1} p(i)$。
  • 应用一种自顶向下的递归算法(类似于 Shannon-Fano),将符号分组为大小为 2 的幂的块,以最小化不平衡性,使用 $|S(k_1^h, P) - 0.5|$ 作为分割标准。
  • 利用 Kraft 不等式和单调性约束,确保前缀码的有效性与最优结构,假设码长分布满足单调性 $n(i) \geq n(i+1)$。
  • 采用参数化码族 $\text{Code } k$,包含参数 $\alpha, \beta, \mu, \tau, \upsilon$,用于建模多种码类型(如 $\gamma$、$\omega$、$\text{EG}_k$),实现系统化的比较。

实验结果

研究问题

  • RQ1如何设计前缀码,使其在无限字母表源具有幂律分布(特别是 $p(i) \sim i^{-\alpha}$,$\alpha > 1$)时实现近似最优压缩?
  • RQ2这些新码在 zeta 分布($\zeta(2)$)和 Gauss-Kuzmin 分布等知名分布下的精确期望码字长度是多少?
  • RQ3所提出的码在幂律分布数据的每符号平均比特数方面,能否优于 Golomb、Rice 和 Elias 等现有编码?
  • RQ4如何利用基于熵的界,严格估计在无限字母表上递归自适应前缀码的性能?
  • RQ5鉴于连分数展开中的系数服从 Gauss-Kuzmin 分布,这些码在有理数压缩方面能实现多大程度的改进?

主要发现

  • 所提出的 $\omega$-码在 Gauss-Kuzmin 分布下的期望码字长度低于现有编码,该分布用于建模有理数连分数展开中的系数。
  • 对于参数为 $\zeta(2)$ 的 zeta 分布,新码相比标准的 Golomb 和 Rice 码显著降低了期望码字长度。
  • 基于熵的界 $\sum p(i)n(i) \geq H_x + (y_x + \lg(1 - \sigma_x))(1 - \sigma_x)$ 提供了紧致且严格的期望码长估计,支持精确的性能评估。
  • 采用大小为 $2^{g_i}$ 的块与完整二叉码表示偏移量的递归码构造方法,在多种幂律分布上实现了接近最优的性能,其表现接近理论熵极限。
  • 基于最小化 $|S(k_1^h, P) - 0.5|$ 选择块大小的算法,相比先前方法实现了更均衡的分组,从而提升了压缩效率。
  • 该方法支持高效的在线码生成与性能估计,适用于实际应用场景,如算术编码和有理数压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。