Skip to main content
QUICK REVIEW

[论文解读] Authorship Attribution Using the Chaos Game Representation

Daniel Lichtblau, Cătălin Stoean|arXiv (Cornell University)|Feb 14, 2018
Authorship Attribution and Profiling参考文献 46被引用 3
一句话总结

本文提出了一种新颖的作者归属方法,通过使用16个字符的字母映射将文本转换为灰度图像,再应用机器学习分类器识别作者。该方法在《联邦党人文集》上实现了具有竞争力的准确率——Top-1准确率为82%,Top-4准确率为93%,在英语和葡萄牙语数据集上均表现出色,具有数字指纹识别和抄袭检测的潜力。

ABSTRACT

The Chaos Game Representation, a method for creating images from nucleotide sequences, is modified to make images from chunks of text documents. Machine learning methods are then applied to train classifiers based on authorship. Experiments are conducted on several benchmark data sets in English, including the widely used Federalist Papers, and one in Portuguese. Validation results for the trained classifiers are competitive with the best methods in prior literature. The methodology is also successfully applied for text categorization with encouraging results. One classifier method is moreover seen to hold promise for the task of digital fingerprinting.

研究动机与目标

  • 解决匿名文本中作者归属的挑战,特别是在电子邮件、博客和论坛等数字环境中的应用。
  • 通过引入文本风格的视觉表示,克服传统词汇和句法方法的局限性。
  • 开发一种语言无关的方法,适用于拉丁字母文本,无需词典或语言学预处理。
  • 探索基于CGR的图像作为抄袭检测和文本认证的数字指纹的可行性。
  • 在基准数据集(包括《联邦党人文集》和葡萄牙语语料库)上验证该方法,以评估其泛化能力和鲁棒性。

提出的方法

  • 使用语音和正字法等价类将原文映射到一个简化的16个字符字母表,以平衡字符频率。
  • 应用混沌博弈表示法(CGR)将每个文本块转换为基于16个字符序列的2D灰度图像。
  • 使用特征提取技术(如图像的傅里叶变换(FTT)和主成分分析(PCA))将图像维度降低至28个特征。
  • 在基于图像的特征上训练多种机器学习分类器(包括k-NN和逻辑回归),以预测作者归属。
  • 在特征空间中使用基于距离的评分(如倒数距离)对候选作者进行排序,以确定最可能的作者。
  • 在作者归属和文体分类任务上测试该方法,采用交叉验证和基准数据集。

实验结果

研究问题

  • RQ1混沌博弈表示法能否有效将文本风格转换为保留作者特异性模式的图像特征?
  • RQ2在标准基准测试中,所提出的基于CGR的方法与当前最先进的作者归属技术相比,准确率如何?
  • RQ3该方法在无需语言特定调优的情况下,能在多大程度上在不同语言(如英语和葡萄牙语)之间实现泛化?
  • RQ4从CGR导出的基于图像的特征能否作为紧凑可靠的数字指纹用于抄袭检测?
  • RQ5该方法在短文本(如电子邮件或博客文章中的文本)上是否仍能保持高性能?

主要发现

  • 当使用逻辑回归(LR)作为分类器时,该方法在《联邦党人文集》上的正确作者识别准确率达到82%。
  • 在93%的测试案例中,正确作者位于使用LR分类器预测的前四位候选者之中。
  • FTT+PCA方法在文体分类中达到82.5%的准确率,其中9.25%的案例中正确文体为第二预测结果。
  • FTT+PCA方法为每段文本生成一个紧凑的28维特征向量,适用于作为抄袭筛查中的数字指纹。
  • 该方法在葡萄牙语数据集上表现出色,表明其具有在极少调整下实现跨语言应用的潜力。
  • 即使在仅1,000个字符的短文本上,该方法仍保持合理的准确率,表明其适用于现实世界中的匿名数字内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。