Skip to main content
QUICK REVIEW

[论文解读] LLMZip: Lossless Text Compression using Large Language Models

Chandra Shekhara Kaushik Valmeekam, Krishna R. Narayanan|arXiv (Cornell University)|Jun 6, 2023
Algorithms and Data Compression被引用 4
一句话总结

该论文提出 LLMZip,一种无损文本压缩方法,利用 LLaMA-7B 语言模型作为预测压缩器,通过其下一个词元的概率估计指导算术编码。该方法在 text8 数据集上实现了 0.709 比特/字符的记录性最低渐近熵上界,并达到 0.7101 比特/字符的压缩比,优于当前最先进的工具如 BSC、ZPAQ 和 paq8h。

ABSTRACT

We provide new estimates of an asymptotic upper bound on the entropy of English using the large language model LLaMA-7B as a predictor for the next token given a window of past tokens. This estimate is significantly smaller than currently available estimates in \cite{cover1978convergent}, \cite{lutati2023focus}. A natural byproduct is an algorithm for lossless compression of English text which combines the prediction from the large language model with a lossless compression scheme. Preliminary results from limited experiments suggest that our scheme outperforms state-of-the-art text compression schemes such as BSC, ZPAQ, and paq8h.

研究动机与目标

  • 利用 LLaMA-7B 作为预测模型,估计英语文本的渐近熵上界。
  • 开发一种结合 LLaMA-7B 下一个词元预测与算术编码的无损压缩方案。
  • 将基于 LLaMA-7B 的压缩系统与当前最先进的压缩器(如 BSC、ZPAQ 和 paq8h)进行压缩性能对比评估。
  • 证明大型语言模型可通过降低熵估计值并实现更优压缩比,显著提升无损文本压缩性能。

提出的方法

  • 使用 LLaMA-7B 模型作为上下文感知预测器,基于过去词元的滑动窗口估计下一个词元的概率分布。
  • 对于每个词元,模型生成候选词元及其概率的排序列表,并记录实际下一个词元的排名。
  • 然后使用算术编码对排名信息进行编码,基于其预测概率高效压缩排名序列。
  • 压缩比计算为总使用比特数除以原始文本中的字符数。
  • 熵上界通过测试集上预测分布的平均交叉熵进行估计。
  • 该方法在两个数据集上进行评估:text8 数据集的一个 1MB 片段和来自 Project Gutenberg 书籍的一个 100KB 摘要。

实验结果

研究问题

  • RQ1当使用 LLaMA-7B 语言模型进行预测时,英语文本的渐近熵上界是多少?
  • RQ2大型语言模型能否有效超越现有最先进方法,显著提升无损文本压缩性能?
  • RQ3基于 LLM 的压缩器在标准基准测试中,其压缩比与传统压缩器(如 BSC、ZPAQ 和 paq8h)相比如何?
  • RQ4随着上下文窗口大小(记忆 M)的增加,LLMZip 的压缩性能是否提升?
  • RQ5在不同文本来源(如 text8 数据集和已出版的书籍)中,熵估计值和压缩比如何变化?

主要发现

  • 基于 LLaMA-7B 的压缩器在 text8 数据集的一个 1MB 片段上实现了 0.7101 比特/字符的压缩比,显著优于 BSC、ZPAQ 和 paq8h。
  • 利用 LLaMA-7B 估计的英语文本渐近熵上界为 0.709 比特/字符,低于文献中先前的估计值。
  • 在来自 Project Gutenberg 书籍的一个 100KB 摘要上,压缩比为 0.8426 比特/字符,熵上界为 0.8417 比特/字符。
  • 随着上下文窗口大小(M)的增加,压缩比持续提升,M=511 时性能最佳。
  • 基于 LLaMA-7B 的系统实现了 0.7101 bpc 的压缩比,非常接近估计的熵上界 0.7093 bpc,表明其接近最优压缩效率。
  • LLaMA 基压缩器的性能显著优于 zlib 算法,后者在相同文本上仅实现 2.80 bpc,凸显了使用 LLM 进行预测的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。