Skip to main content
QUICK REVIEW

[论文解读] Fully Online Grammar Compression in Constant Space

Shirou Maruyama, Yasuo Tabei|arXiv (Cornell University)|Jan 21, 2014
Algorithms and Data Compression参考文献 8被引用 10
一句话总结

本文提出了 FREQ_FOLCA 和 LOSSY_FOLCA 两种新型的完全在线语法压缩变体,通过仅在哈希表中保留频繁的产生规则,利用流挖掘技术实现恒定的工作空间。这些方法能够在保持高压缩率和线性时间复杂度的同时,高效压缩和解压缩大规模、噪声较多的重复文本(如人类基因组),在内存效率和可扩展性方面优于先前的方法。

ABSTRACT

We present novel variants of fully online LCA (FOLCA), a fully online grammar compression that builds a straight line program (SLP) and directly encodes it into a succinct representation in an online manner. FOLCA enables a direct encoding of an SLP into a succinct representation that is asymptotically equivalent to an information theoretic lower bound for representing an SLP (Maruyama et al., SPIRE'13). The compression of FOLCA takes linear time proportional to the length of an input text and its working space depends only on the size of the SLP, which enables us to apply FOLCA to large-scale repetitive texts. Recent repetitive texts, however, include some noise. For example, current sequencing technology has significant error rates, which embeds noise into genome sequences. For such noisy repetitive texts, FOLCA working in the SLP size consumes a large amount of memory. We present two variants of FOLCA working in constant space by leveraging the idea behind stream mining techniques. Experiments using 100 human genomes corresponding to about 300GB from the 1000 human genomes project revealed the applicability of our method to large-scale, noisy repetitive texts.

研究动机与目标

  • 解决现有语法压缩方法在应用于大规模、噪声较多的重复文本(如人类基因组序列)时内存消耗过高的问题。
  • 克服 FOLCA 的局限性,后者需要与 SLP 大小成比例的工作空间,使其在噪声多、规模大的数据上不可行。
  • 开发完全在线的语法压缩算法,在保持高效率的同时实现恒定的工作空间。
  • 实现在标准硬件上对大规模重复文本集合(如 100 个人类基因组)的实际压缩与解压缩。
  • 提出一种仅在内存中保留频繁产生规则的策略,受流挖掘启发,以减少空间使用,同时不牺牲压缩质量。

提出的方法

  • 利用流挖掘技术,仅在哈希表中维护频繁出现的产生规则,丢弃不频繁的规则以节省内存。
  • 设计 FREQ_FOLCA,基于频率阈值 k 优先存储最频繁的产生规则,将工作空间减少至常数。
  • 设计 LOSSY_FOLCA,采用有损过滤策略,根据参数 ℓ 移除不频繁的规则,实现恒定空间并可控地降低压缩质量。
  • 采用基于位串和标签序列的 SLP 精简表示,支持从二级存储高效解压缩。
  • 通过基于频率的过滤策略,保持反向字典的哈希表规模较小,确保压缩过程中工作空间恒定。
  • 通过单次遍历输入文本实现在线压缩与解压缩,在整个过程中保持恒定空间。

实验结果

研究问题

  • RQ1能否使语法压缩在大规模、噪声较多的重复文本上实现完全在线且恒定工作空间?
  • RQ2如何识别并保留内存中的频繁产生规则,以最小化空间使用同时保持高压缩率?
  • RQ3在使用基于频率的产生规则过滤时,压缩率与工作空间之间的权衡关系如何?
  • RQ4恒定空间语法压缩能否有效应用于真实世界中的噪声数据(如人类基因组序列)?
  • RQ5在内存使用、运行时间和压缩率方面,所提方法与现有压缩器(如 FOLCA、LZMA、BLOCK_FOLCA)相比表现如何?

主要发现

  • FREQ_FOLCA 和 LOSSY_FOLCA 实现了恒定的工作空间——FREQ_FOLCA 为 36–76 GB,LOSSY_FOLCA 为 36–56 GB,与输入大小无关,而 FOLCA 在处理 52 GB 基因组时所需内存超过 100 GB。
  • 使用 FREQ_FOLCA 和 LOSSY_FOLCA 压缩 100 个人类基因组(306 GB)在 24 小时内完成,而 LZMA 在 5 天内未能完成。
  • LOSSY_FOLCA 在最大 56.9 MB 工作空间下实现了 17.45% 的压缩率,优于相同参数设置下的 BLOCK_FOLCA(25.91% 压缩率,34.7 MB 工作空间)。
  • FREQ_FOLCA 在 76.1 MB 工作空间下实现了 19.71% 的压缩率,展示了压缩率与内存使用之间的权衡。
  • 两种变体的解压缩时间均低于 23,000 秒,表明尽管采用恒定空间操作,仍具备高效的解压缩性能。
  • 所提方法成功处理了来自 1000 个基因组计划的真实世界噪声重复数据,证明了其在大规模基因组数据上的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。