[论文解读] Online Self-Indexed Grammar Compression
本文提出了OESP-index,这是首个在线自索引语法压缩方法,通过逐字符处理输入文本,增量式构建压缩索引,无需在内存中存储完整输入,实现了空间高效的构建。该方法在空间效率方面表现优异,支持高效的模式搜索与随机访问,在工作空间使用上优于离线方法,同时在高度重复文本上保持了实际可用的性能。
Although several grammar-based self-indexes have been proposed thus far, their applicability is limited to offline settings where whole input texts are prepared, thus requiring to rebuild index structures for given additional inputs, which is often the case in the big data era. In this paper, we present the first online self-indexed grammar compression named OESP-index that can gradually build the index structure by reading input characters one-by-one. Such a property is another advantage which enables saving a working space for construction, because we do not need to store input texts in memory. We experimentally test OESP-index on the ability to build index structures and search query texts, and we show OESP-index's efficiency, especially space-efficiency for building index structures.
研究动机与目标
- 为解决现有基于语法的自索引方法的局限性,即需要离线构建且在处理大规模重复文本集合时需要大量工作内存。
- 通过逐字符处理输入文本,实现增量式索引构建,降低内存开销。
- 在压缩形式下支持高效的模式搜索与随机访问,适用于具有动态演化特性的大数据工作负载。
- 证明在线语法压缩可与离线方法在空间与时间效率方面达到相当水平。
提出的方法
- OESP-index基于编辑敏感解析(ESP),并利用FOLCA(完全在线LCA)框架实现在线语法压缩。
- 采用动态波特树(DWT)表示字典与长度数组,支持高效的秩/选择操作,以实现随机访问。
- 该方法维护从输入流中导出的上下文无关文法(CFG)的紧凑表示,逐步扩展解析树。
- 采用GMR风格的秩/选择操作处理位串,并结合动态波特树,以支持快速的模式搜索与计数。
- 数据结构支持自顶向下遍历解析树以定位候选模式出现位置,利用ESP的解析差异界限。
- 构建过程为在线处理:每个字符依次处理,索引增量式更新,无需在内存中存储完整文本。
实验结果
研究问题
- RQ1能否使基于语法的自索引实现在线化,从而在无需将完整文本存储于内存的情况下,从流式输入中增量构建索引?
- RQ2在构建高度重复文本的索引时,与离线方法相比,在线自索引的空间效率如何?
- RQ3与优化的离线方法相比,在线构建与查询处理的性能开销如何?
- RQ4在线语法压缩能否支持高效的模式搜索与随机访问,并具备可接受的时间复杂度?
- RQ5在在线环境下,动态波特树与位串表示如何影响内存使用与查询性能?
主要发现
- 在einstein数据集上,OESP-index仅使用离线ESP-index所需工作内存的2.5%,展现出显著的空间效率优势。
- 在cere数据集上,OESP-index的工作内存使用量为离线ESP-index的40%,证实其在重复性较低的数据上也具备内存优势。
- OESP-index的索引大小小于LZ-index与FM-index,但大于ESP-index与SLP-index,主要开销来自动态波特树。
- 构建时间慢于离线ESP-index——在einstein上慢57.1倍,在cere上慢58.1倍——原因在于在线版本缺乏GMR优化的波特树。
- 查询定位时间慢于ESP-index(einstein上慢24.9倍,cere上慢163.2倍),但该方法仍能支持具有理论保证的实际模式搜索。
- 尽管存在性能权衡,OESP-index仍是首个在线基于语法的自索引,可实现对大规模、动态演化、高度重复文本集合的可扩展处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。