[论文解读] Higher Criticism for Discriminating Word-Frequency Tables and Testing Authorship
本文提出了一种新颖的、自动化的作者归属方法,利用高阶临界值(HC)统计量衡量词频表之间的差异,无需人工特征工程。通过将二项式模型应用于词频,并利用HC对低方差、作者特异性词的敏感性,该方法在识别作者方面实现了最先进水平的准确率,且HC检验本身会自动选择反映作者风格而非主题结构的判别性词汇。
We adapt the Higher Criticism (HC) goodness-of-fit test to measure the closeness between word-frequency tables. We apply this measure to authorship attribution challenges, where the goal is to identify the author of a document using other documents whose authorship is known. The method is simple yet performs well without handcrafting and tuning; reporting accuracy at the state of the art level in various current challenges. As an inherent side effect, the HC calculation identifies a subset of discriminating words. In practice, the identified words have low variance across documents belonging to a corpus of homogeneous authorship. We conclude that in comparing the similarity of a new document and a corpus of a single author, HC is mostly affected by words characteristic of the author and is relatively unaffected by topic structure.
研究动机与目标
- 开发一种无需手动特征选择的自动化、非调参作者归属方法。
- 评估高阶临界值统计量是否能有效衡量作者归属任务中词频表之间的相似性。
- 探究HC识别出的词汇是否反映作者特征而非主题特征。
- 证明该方法在无需前期特征工程的情况下性能达到最先进水平。
提出的方法
- 该方法使用二项式分配模型,将文档的词频与参考语料库中的词频进行比较,计算词级别的P值。
- 将高阶临界值(HC)统计量应用于这些P值,聚合为两个词频表之间的全局差异度量d_HC。
- HC检验本身会识别出对差异贡献最大的词汇子集,这些词汇在同质语料库中表现出较低的方差。
- 通过选择与测试文档d_HC得分最小的语料库来实现作者归属。
- 该方法在多个作者归属挑战任务中得到应用,包括联邦党人文集,且未进行任何超参数调优。
- 该方法通过评估语料库内词频的变异系数(CV),判断所选词汇是否反映作者风格而非主题。
实验结果
研究问题
- RQ1高阶临界值统计量能否作为作者归属任务中词频表之间相似性的一种有效、自动化度量?
- RQ2HC检验所选择的词汇是否对应于低方差、作者特异性的特征,而非依赖主题的特征?
- RQ3在无需调优或特征工程的情况下,基于HC的方法在作者归属任务中的性能如何与现有最先进方法比较?
- RQ4HC差异在多大程度上由作者特征词汇驱动,而非主题结构特征?
主要发现
- 基于HC的方法在无需任何手动特征选择或超参数调优的情况下,实现了作者归属的最先进准确率。
- HC检验识别出的词汇在同质作者语料库中表现出显著更低的变异系数(CV),表明其稳定且具有作者特异性。
- 该方法对在语料库中方差较低的词汇最为敏感,表明其捕捉的是作者风格而非主题相关的变异。
- 在一致(同作者)文档-语料对中,低HC P值排名词汇的平均CV显著低于不一致对,证实了该方法对作者特征的敏感性。
- HC阈值始终能识别出一组CV较低的词汇,且该组词汇与作者特异性词汇使用模式具有强相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。