[论文解读] Rethinking the Authorship Verification Experimental Setups
本文提出了五种新的、逐步更具挑战性的PAN作者身份验证数据集划分方式,以解决现有基准测试中的数据泄露和泛化问题。通过隔离主题和风格偏差,并将命名实体替换为占位符,基于BERT的模型实现了更好的泛化能力,尤其是在分布外的DarkReddit数据集上表现更优,表明依赖虚假命名实体线索的模型在分布偏移下表现较差。
One of the main drivers of the recent advances in authorship verification is the PAN large-scale authorship dataset. Despite generating significant progress in the field, inconsistent performance differences between the closed and open test sets have been reported. To this end, we improve the experimental setup by proposing five new public splits over the PAN dataset, specifically designed to isolate and identify biases related to the text topic and to the author's writing style. We evaluate several BERT-like baselines on these splits, showing that such models are competitive with authorship verification state-of-the-art methods. Furthermore, using explainable AI, we find that these baselines are biased towards named entities. We show that models trained without the named entities obtain better results and generalize better when tested on DarkReddit, our new dataset for authorship verification.
研究动机与目标
- 解决PAN作者身份验证基准中闭集与开集测试集之间性能不一致的问题。
- 在现有实验设置中隔离并缓解与文本主题和作者写作风格相关的偏差。
- 通过减少对虚假特征(如命名实体)的依赖,提升模型泛化能力。
- 引入一个新的分布外数据集DarkReddit,以评估跨语料库的泛化能力。
- 提供公开可获取、可复现的划分方式与基线模型,以支持大规模模型评估与未来研究。
提出的方法
- 设计五种新的数据集划分方式——闭集、闭开集、开集未见作者、开集未见粉丝圈,以及全开集——涵盖从闭集到完全开集的配置。
- 采用基于BERT的模型作为基线,微调其在训练划分上的表现,并在五个测试划分上评估泛化能力。
- 使用积分梯度法进行可解释人工智能(XAI)分析,以研究模型注意力机制并识别对命名实体的依赖。
- 将训练数据中的命名实体替换为占位符(如[PERSON]、[LOCATION]),以减少对虚假特征的学习。
- 在PAN和新引入的DarkReddit数据集上训练并评估模型,以测试在分布偏移下的零样本泛化能力。
- 对长文档进行512-token序列块的预测聚合,以应对BERT的上下文长度限制。
实验结果
研究问题
- RQ1现有PAN数据集划分在多大程度上引入了数据泄露,从而人为提高了闭集评估的性能?
- RQ2基于BERT的模型在逐步开放的实验设置下表现如何?当训练时去除命名实体后,其泛化能力是否有所提升?
- RQ3命名实体在作者身份验证决策中扮演何种角色?其移除是否能提升模型鲁棒性?
- RQ4在PAN上训练的模型在显著不同的领域(如DarkReddit)上泛化能力如何?
- RQ5一个简单的数据预处理步骤——将命名实体替换为占位符——是否能带来可测量的性能提升并改善泛化能力?
主要发现
- 基于BERT的模型表现具有竞争力,在闭开集划分上得分达到97.4%,在开集未见粉丝圈划分上达到91.6%,优于非神经网络基线模型,并接近SOTA的O2D2结果。
- 去除命名实体后训练的模型在DarkReddit测试集上的F1得分提升了5.6%,证实其在分布偏移下具备更好的泛化能力。
- 积分梯度分析显示,模型在作者身份验证决策中严重依赖命名实体,尤其是在开集场景下。
- 将命名实体替换为占位符后,全开集划分上的整体性能提升了1.4分(从81.7提升至83.1),AUC从91.1提升至94.3。
- O2D2模型在最具挑战性的全开集划分上表现欠佳,而去除命名实体后训练的BERT模型则表现出显著更好的泛化能力。
- 当去除命名实体后,开发集上的表现更能预测测试集表现,表明对虚假特征的过拟合现象减少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。