Skip to main content
QUICK REVIEW

[论文解读] Authorship Attribution Using a Neural Network Language Model

Zhenhao Ge, Yufang Sun|arXiv (Cornell University)|Feb 17, 2016
Authorship Attribution and Profiling参考文献 4被引用 9
一句话总结

本文提出一种前馈神经网络语言模型(NNLM),用于在文本数据有限的情况下进行作者归属分析,其性能优于采用Kneser-Ney平滑的N-gram模型。在仅使用五句话的测试集上,该方法实现了平均3.43%的准确率提升和2.5%的困惑度降低,表明在数据受限条件下仍具有优异性能。

ABSTRACT

In practice, training language models for individual authors is often expensive because of limited data resources. In such cases, Neural Network Language Models (NNLMs), generally outperform the traditional non-parametric N-gram models. Here we investigate the performance of a feed-forward NNLM on an authorship attribution problem, with moderate author set size and relatively limited data. We also consider how the text topics impact performance. Compared with a well-constructed N-gram baseline method with Kneser-Ney smoothing, the proposed method achieves nearly 2:5% reduction in perplexity and increases author classification accuracy by 3:43% on average, given as few as 5 test sentences. The performance is very competitive with the state of the art in terms of accuracy and demand on test data. The source code, preprocessed datasets, a detailed description of the methodology and results are available at https://github.com/zge/authorship-attribution.

研究动机与目标

  • 在传统语言模型表现不佳的低数据场景下,提升作者归属分析的准确率。
  • 评估前馈NNLM相较于采用Kneser-Ney平滑的常规N-gram模型的有效性。
  • 探究文本主题对作者分类性能的影响。
  • 开发一种计算高效、可定制的NNLM框架,适用于数据有限的场景。
  • 提供开源代码和数据集,以支持可复现性及后续研究。

提出的方法

  • 使用4元语法上下文训练前馈神经网络语言模型,以预测下一个词,词嵌入通过反向传播学习得到。
  • 词输入以独热向量表示,并通过嵌入层映射为密集分布式表示。
  • 模型采用隐藏层的S型激活函数,随后通过Softmax输出层预测词的概率,训练过程由多项式交叉熵损失函数指导。
  • 学习率、动量和隐藏层大小等模型参数针对每位作者进行调优,以优化性能。
  • 从16门STEM领域的Coursera课程中提取文本数据,使用Porter词干提取法和词频剪枝进行预处理,将每位作者的词汇量缩减至1800至2700个词之间。
  • 数据集按80%训练集、10%验证集和10%测试集进行划分,并进行10次随机划分以计算性能指标的均值与方差。

实验结果

研究问题

  • RQ1在数据有限的情况下,前馈NNLM与经过充分调优的Kneser-Ney平滑N-gram基线模型在作者归属分析中的表现如何比较?
  • RQ2文本主题在多大程度上影响作者归属模型的性能?
  • RQ3计算高效的前馈NNLM是否能在极少量训练数据下取得具有竞争力的结果?
  • RQ4用于分类的测试句子数量如何影响模型性能?
  • RQ5与传统N-gram模型相比,NNLM是否对作者写作风格更敏感,或对主题相关模式更敏感?

主要发现

  • 所提出的NNLM相较于采用Kneser-Ney平滑的N-gram基线模型,平均实现了3.43%的作者分类准确率提升。
  • NNLM平均将困惑度降低了2.5%,其平均困惑度为67.3 ± 2.4,而N-gram模型为69.0 ± 2.4。
  • 即使仅使用五句话的测试样本,NNLM仍保持了强劲的性能,表明其对低数据量具有鲁棒性。
  • 模型在同一位教师讲授的两门课程之间混淆度较高,表明其对作者写作风格更敏感,而非主题。
  • 性能在整体上保持稳定且具有竞争力,尤其考虑到作者数量有限且训练/测试数据分布一致。
  • 结果表明,若训练集与测试集的主题保持一致,可能降低数据集的挑战性,从而可能限制观察到的性能差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。