Skip to main content
QUICK REVIEW

[论文解读] Unsupervised authorship attribution

David A. Fifield, Torbjørn Follan|arXiv (Cornell University)|Mar 26, 2015
Authorship Attribution and Profiling参考文献 9被引用 4
一句话总结

本文提出了一种无监督作者归属方法,通过使用多个重叠的片段聚类,对文本段落分配概率化的作者归属权重,而无需事先了解写作风格。通过在多个聚类中移动片段边界并利用成对一致性对齐标签,该方法实现了作者归属的细粒度、平滑过渡,在圣经文本分割上的真实标签一致性达到72%。

ABSTRACT

We describe a technique for attributing parts of a written text to a set of unknown authors. Nothing is assumed to be known a priori about the writing styles of potential authors. We use multiple independent clusterings of an input text to identify parts that are similar and dissimilar to one another. We describe algorithms necessary to combine the multiple clusterings into a meaningful output. We show results of the application of the technique on texts having multiple writing styles.

研究动机与目标

  • 解决在缺乏训练数据或作者写作风格先验知识的情况下,文本作者归属的挑战。
  • 实现在作者变化渐进或未明确标记的情况下,对文本段落进行细粒度的多作者归属。
  • 克服片段长度(用于风格代表性)与分辨率(用于检测作者变化)之间的权衡。
  • 开发一种稳健的方法,将多个独立聚类整合为一致的、平均化的作者归属分配。
  • 通过最大化成对一致性,确保在任意标签方案下,聚类间的标签一致性。

提出的方法

  • 将输入文本分割为固定长度(例如1000字)的重叠片段,通过连续偏移(例如50字)生成多个片段集合。
  • 对每个片段集合独立应用聚类(例如使用文体特征或基于压缩的相似性),以将风格相似的段落分组。
  • 通过排列策略对所有聚类中的标签进行重命名,以最大化成对一致性,从而对齐不同运行中的聚类身份。
  • 计算重命名后聚类的平均值,生成每个段落对n位作者的软性、概率化归属。
  • 使用JStylo的“WritePrints (Limited)”特征集从片段中提取文体特征以进行聚类。
  • 应用降维技术(例如随机投影)以提高高维特征向量上的聚类性能。

实验结果

研究问题

  • RQ1无监督重叠片段聚类是否能可靠检测作者归属的变化,而无需对已知作者进行训练?
  • RQ2与单聚类方法相比,重叠片段聚类在作者归属中的分辨率和平滑性方面有何提升?
  • RQ3在多个聚类间进行标签对齐在多大程度上能减少噪声并提高作者归属的一致性?
  • RQ4该方法在真实多作者文本上的表现如何,特别是在作者变化渐进或未明确划分的情况下?
  • RQ5在无监督设置下,降维对聚类质量和归属准确性有何影响?

主要发现

  • 该方法在《阿波罗颂歌》狄罗斯部分1768字的片段上与真实标签达到了72%的一致性,表明在真实多作者文本上表现强劲。
  • 在《皮提亚颂歌》3726字的片段上应用时,该方法与真实标签的最大一致性达到约76%,表明在长段落上具有高度可靠性。
  • 通过降维(例如随机投影)提升了聚类性能,使在翻译后的颂歌中的一致性从56%提高到72%。
  • 该方法成功实现了作者归属的平滑过渡,尤其在作者变化渐进的区域表现突出,如图5.2所示。
  • 通过标签排列和平均化,该方法优于基线聚类方法,显著减少了多次运行中的标签不一致性。
  • 该方法对片段大小和偏移量的选择具有鲁棒性,20个重叠聚类(1000字片段,50字偏移)提供了最佳分辨率与稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。