Skip to main content
QUICK REVIEW

[论文解读] A Machine Learning Framework for Authorship Identification From Texts

Rahul Radhakrishnan Iyer, Carolyn Penstein Rosé|arXiv (Cornell University)|Dec 21, 2019
Authorship Attribution and Profiling参考文献 20被引用 8
一句话总结

本文提出了一种基于风格特征的监督机器学习框架,用于作者识别,包括词性(POS)二元语法和字符n-gram,结合文本特征如词一元语法和二元语法。该方法在包含50位作者的保留测试集上实现了81.6%的准确率,表明整合语言学风格特征可显著提升分类性能,优于基线一元语法模型。

ABSTRACT

Authorship identification is a process in which the author of a text is identified. Most known literary texts can easily be attributed to a certain author because they are, for example, signed. Yet sometimes we find unfinished pieces of work or a whole bunch of manuscripts with a wide variety of possible authors. In order to assess the importance of such a manuscript, it is vital to know who wrote it. In this work, we aim to develop a machine learning framework to effectively determine authorship. We formulate the task as a single-label multi-class text categorization problem and propose a supervised machine learning framework incorporating stylometric features. This task is highly interdisciplinary in that it takes advantage of machine learning, information retrieval, and natural language processing. We present an approach and a model which learns the differences in writing style between $50$ different authors and is able to predict the author of a new text with high accuracy. The accuracy is seen to increase significantly after introducing certain linguistic stylometric features along with text features.

研究动机与目标

  • 开发一种稳健的机器学习框架,利用风格特征和语言学特征识别未见文本的作者。
  • 探究新型特征空间(特别是POS二元语法)在提升作者识别准确率方面的有效性。
  • 评估结合文本特征(如一元语法、二元语法)与风格特征(如功能词、n-gram)对分类性能的影响。
  • 评估模型在保留测试集上的泛化性能,并与基线模型进行比较。
  • 探讨在处理短文本和非英文语料时的局限性,并为未来工作指明方向。

提出的方法

  • 将作者识别建模为单标签多分类文本分类问题。
  • 使用LibLINEAR支持向量机分类器,基于文本特征(词一元语法、二元语法)与风格特征(功能词、字符n-gram、POS二元语法、词-POS组合)的组合进行训练。
  • 采用10折交叉验证进行超参数调优和模型选择,仅调整偏置项。
  • 执行特征选择以优化模型并提升泛化能力。
  • 在交叉验证和调优后,使用保留测试集进行最终评估。
  • 采用统计显著性检验(t检验,p值)评估优化模型相较于基线模型的性能提升。

实验结果

研究问题

  • RQ1将词性(POS)二元语法整合到特征空间是否能显著提升作者识别的准确率?
  • RQ2与仅使用基线文本特征相比,引入风格特征(如功能词、字符n-gram)对分类性能有何影响?
  • RQ3该模型的性能是否能在未见数据上泛化?与仅使用词一元语法的基线模型相比如何?
  • RQ4该模型在短文本(如微博帖子)或非英文语料上的泛化能力如何?
  • RQ5通过特征工程和模型优化所获得的性能提升在统计上是否显著?

主要发现

  • 优化后的模型在保留测试集上达到81.6%的准确率和0.8122的Cohen’s kappa,优于基线模型的79.8%准确率和0.7939的kappa。
  • 准确率的提升在统计上不显著(p = 0.106,t = -1.619),表明尽管性能有所提高,但该增益可能无法可靠地区别于随机水平。
  • 表现最佳的模型使用了偏置项为1的设置,即默认值,表明在此情况下无需进行超参数调优。
  • 错误分析证实,风格特征的引入显著提升了模型性能,支持了此类特征是作者风格强指标的假设。
  • POS二元语法和词-POS组合对性能有实质性贡献,表明句法模式是可靠的风格标记。
  • 该模型在未见数据上具有合理的泛化能力,超过80%的测试实例被正确分类,尽管在极短文本和非英文语言上仍存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。