[论文解读] Authorship Attribution Using Word Network Features
本文提出了一种从文本复杂网络属性派生的新颖词网络特征,用于作者归属分析,表明局部图特征——尤其是顶点核心度与聚类系数——在基准数据集上显著提升了分类准确率,优于传统的词频和汇总图特征,尤其在结合大规模停用词代表性集合时表现更优。
In this paper, we explore a set of novel features for authorship attribution of documents. These features are derived from a word network representation of natural language text. As has been noted in previous studies, natural language tends to show complex network structure at word level, with low degrees of separation and scale-free (power law) degree distribution. There has also been work on authorship attribution that incorporates ideas from complex networks. The goal of our paper is to explore properties of these complex networks that are suitable as features for machine-learning-based authorship attribution of documents. We performed experiments on three different datasets, and obtained promising results.
研究动机与目标
- 研究从词网络中提取的复杂网络特征在基于机器学习的作者归属分析中的实用性。
- 识别哪些网络属性(局部 vs. 全局,频率派 vs. 非频率派)最能有效区分作者风格。
- 在大规模及竞赛级数据集(包括AAAC和PAN12)上评估这些特征,以评估其在真实场景下的表现。
- 将词网络特征与标准词频基线及现有最先进方法的性能进行比较。
提出的方法
- 通过将唯一词汇视为节点,并将文本中相邻的词汇连接为边,从文档构建词网络。
- 提取一组全面的网络特征:顶点度、聚类系数、核心度、邻域大小以及图汇总统计量(如直径、密度)。
- 使用代表性词汇集合(如最常出现的前500个词、停用词)计算局部特征,以降低维度并聚焦于显著的风格线索。
- 在结合了词频与网络特征的文档级特征向量上训练并评估多种分类器(如Logit Boost、k-NN)。
- 进行消融研究,以评估添加原始词频的影响,并比较不同特征类型及代表性词汇集合下的性能表现。
- 应用信息增益排序,以识别Gutenberg数据集中最具区分性的特征,验证特征的相关性。
实验结果
研究问题
- RQ1在作者归属任务中,哪些词网络特征——局部或全局——能带来最强的性能表现?
- RQ2局部特征(如顶点核心度与聚类系数)与传统的词频基线相比,在作者分类中的表现如何?
- RQ3与局部特征相比,图汇总特征(如直径、密度)在作者归属中的贡献程度如何?
- RQ4代表性词汇集合的大小在多大程度上影响局部网络特征(如核心度与聚类系数)的性能?
- RQ5词网络特征是否能超越或匹配在标准化作者归属竞赛(如AAAC和PAN12)中报告的最佳结果?
主要发现
- 局部词网络特征,尤其是顶点核心度与聚类系数,在作者归属任务中显著优于全局图汇总特征。
- 在AAAC数据集上,词网络特征在Logit Boost分类器下达到26.25%的最佳测试集准确率,且在10个问题中的8个问题中性能匹配或超过已有最佳报告结果。
- 在PAN12数据集上,使用Logit Boost的最佳准确率达到33.53%,词网络特征在3个问题中的2个问题上优于基线。
- 添加原始词频作为额外特征仅带来极少或无性能提升,表明网络特征本身已具备高度区分性。
- 在Gutenberg数据集中,按信息增益排序的前20个特征中,包含多个局部网络特征以及高频停用词,证实其对作者风格具有强大的预测能力。
- 顶点核心度的性能对代表性词汇集合的大小较为敏感,在较小集合上表现更优,提示需根据词汇量大小进行细致的特征工程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。