Skip to main content
QUICK REVIEW

[论文解读] Identifying document similarity using a fast estimation of the Levenshtein Distance based on compression and signatures

Peter Coates, Frank Breitinger|arXiv (Cornell University)|Jul 21, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种通过使用有损压缩算法将大文档压缩为签名,再在这些紧凑签名上计算Levenshtein距离(LD)的快速估计方法。该方法在保持高准确率的同时实现了显著的速度提升——压缩比为C时,速度提升可达C²倍,尤其在处理不相似文档和删除操作时表现优异,使数字取证和抄袭检测中的实际相似性检测成为可能。

ABSTRACT

Identifying document similarity has many applications, e.g., source code analysis or plagiarism detection. However, identifying similarities is not trivial and can be time complex. For instance, the Levenshtein Distance is a common metric to define the similarity between two documents but has quadratic runtime which makes it impractical for large documents where large starts with a few hundred kilobytes. In this paper, we present a novel concept that allows estimating the Levenshtein Distance: the algorithm first compresses documents to signatures (similar to hash values) using a user-defined compression ratio. Signatures can then be compared against each other (some constrains apply) where the outcome is the estimated Levenshtein Distance. Our evaluation shows promising results in terms of runtime efficiency and accuracy. In addition, we introduce a significance score allowing examiners to set a threshold and identify related documents.

研究动机与目标

  • 解决精确Levenshtein距离(LD)计算的平方级时间复杂度问题,该问题限制了其在大文档(如>100 KB)中的应用。
  • 在数字取证和抄袭检测等实际场景中实现可行的相似性检测,其中精确LD对大规模数据而言过于耗时。
  • 在无需访问原始文档的情况下,仅通过压缩生成的签名,提供一种近似但准确的LD估计。
  • 引入显著性评分,帮助调查人员根据估计的LD值设定阈值,以识别相关文档。
  • 在现有近似匹配(AM)技术基础上,提供比二值或启发式评分更具可解释性和可量化的相似性度量。

提出的方法

  • 使用用户定义的有损压缩算法(LCA)将输入文档压缩为紧凑签名,通过可配置的压缩比C降低文档大小。
  • 生成包含压缩摘要、文件大小和元数据(如文件名)的“签名”,以支持文档识别和基于大小的过滤。
  • 在签名而非原始文本上计算Levenshtein距离(LD),利用签名比原始文本短几个数量级的特性。
  • 将签名上的LD结果用作估计的Levenshtein距离(eLD),其运行速度相比原始文档的精确LD可近似提升C²倍。
  • 应用约束条件,如要求文档大小相差不超过10倍,以提高估计准确性,尤其在处理删除和插入操作时。
  • 引入基于eLD的显著性评分,使调查人员能够设定阈值以识别相关文档,提升法证应用的实用性。

实验结果

研究问题

  • RQ1基于有损压缩的签名方法能否为大文档提供快速且准确的Levenshtein距离估计?
  • RQ2eLD的估计精度在不同类型的文本修改(如插入、删除、替换)下如何变化?
  • RQ3文档大小相似性在多大程度上影响eLD估计的可靠性?是否可通过附加约束条件加以缓解?
  • RQ4当文档包含大量相同或近似相同的文本块时,该方法是否仍能有效检测出相关文档?
  • RQ5在数字取证应用中,与现有近似匹配技术相比,该方法在性能和准确率方面表现如何?

主要发现

  • 所提方法在压缩比为C时,速度提升约为C²倍,使LD估计可应用于比精确LD可行范围大数百倍的文档。
  • 对于大小相同但不相似的文档,估计结果高度准确;在检测删除操作时表现良好,与真实LD值偏差极小。
  • 当文档大小相近(相差不超过10倍)时,该方法保持高准确率,表明大小归一化可提升估计的可靠性。
  • 显著性评分使调查人员能够设定阈值以识别相关文档,显著增强了在数字取证和抄袭检测中的实际应用价值。
  • 该方法在中长文本(如书籍和长篇文章)中尤为有效,因为在这些场景下精确LD因平方级时间复杂度而变得不切实际。
  • 未来工作需评估该方法在二进制数据(如编译程序、视频)上的性能,并优化δ计算以提升在多样化数据类型上的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。