Skip to main content
QUICK REVIEW

[论文解读] On an Application of Relative Entropy

Dmitry V. Khmelev, William J. Teahan|arXiv (Cornell University)|May 24, 2002
Machine Learning in Bioinformatics参考文献 2被引用 3
一句话总结

本文主张,n阶马尔可夫链模型在作者归属和语言分析中优于基于Lempel-Ziv(LZ)压缩的方法。通过对82位作者的实证比较,结果表明马尔可夫链在82篇测试文本中正确分类了69篇,优于gzip等LZ方法(50篇正确),且在速度和可靠性方面表现更优。

ABSTRACT

We describe general approach to classification of character sequences (texts, DNA) using relative entropy estimated by off-the-shelf compression and Markov Chains and find them precise enough. We also notice that the method for estimating relative entropy described in the paper cond-mat/0108530 "Language Trees..." by D. Benedetto et al. was considered earlier and was found to be easily surpassed by the simple and computationally effective first order Markov Chain approach.

研究动机与目标

  • 挑战Lempel-Ziv压缩在语言分析和作者归属中占优的主张。
  • 证明马尔可夫链模型在自然语言处理中比基于LZ的方法具有更高的分类准确率和效率。
  • 揭示先前研究中相对熵和距离定义的缺陷,包括出现负值以及依赖先验字母表知识。
  • 表明基于LZ的方法在DNA分析中不适用,因其无法整合生物学替换矩阵。
  • 倡导在基于熵的语言分类中采用马尔可夫链,因其具有更强的鲁棒性和性能。

提出的方法

  • 本研究对比了15种压缩程序和一阶马尔可夫链模型在82位作者文本(每篇≥10⁵个字符)上的分类准确率。
  • 马尔可夫链模型基于前n个字符估计字符的n阶条件概率,通过统计依赖关系建模文本结构。
  • 相对熵采用Shannon(1948)和Yaglom & Yaglom(1983)的标准定义计算,确保值非负且统计一致。
  • 作者重新实现并测试了Benedetto等人(2002)提出的语言树方法,发现其存在负熵值和字母表偏差等缺陷。
  • 性能通过保留测试文本中的精确作者识别率进行评估,处理速度以每篇文档的处理时间衡量。
  • 该方法避免依赖LZ压缩,转而采用字符转移的概率建模,更准确捕捉语言结构。

实验结果

研究问题

  • RQ1Lempel-Ziv压缩方法在作者归属任务中是否优于马尔可夫链模型?
  • RQ2先前研究中使用的相对熵度量是否可能产生负值,从而破坏其作为距离度量的有效性?
  • RQ3在语言树中包含俄语在多大程度上影响聚类结果?这是否表明方法依赖于先验字母表知识?
  • RQ4为何尽管早期已有尝试,Lempel-Ziv压缩在DNA序列分析中仍表现不佳?
  • RQ5在实际实现中,基于LZ的方法与马尔可夫链模型在分类速度和准确率方面有何差异?

主要发现

  • 一阶马尔可夫链模型在82篇测试文本中正确识别了69位作者,显著优于gzip(50篇正确)及其他压缩工具。
  • Benedetto等人(2002)提出的基于LZ的方法在实践中产生了负的相对熵值,与理论要求的非负熵相矛盾。
  • 在语言树中引入俄语破坏了其与其它斯拉夫语言的预期聚类,表明该方法依赖于先验字母表知识(如Unicode),从而削弱了其声称的字母表无关性。
  • 实际应用中,马尔可夫链方法比基于LZ的方法更快,这与LZ具有“更高潜力”的说法相矛盾。
  • 基于压缩的方法(如gzip)的表现被其他压缩工具和马尔可夫链模型超越,表明LZ并非作者归属的最优选择。
  • 在生物序列分析中使用替换矩阵(如PAM250、BLOSUM62)与LZ不兼容,这限制了其在DNA分析中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。