[论文解读] Experiments with Neural Networks for Small and Large Scale Authorship Verification
本文提出了两种用于作者身份验证的神经网络模型:适用于小规模数据集和短篇、多样化的文档的转换编码器(TE),以及适用于大规模数据集的并行循环神经网络(PRNN)。TE 通过将一个文档转换为另一个文档的重建损失作为相似性信号,而 PRNN 则通过比较文档对的学得语言模型来进行验证。两种模型在 PAN、Amazon 和 ML 数据集上均表现出稳定且具有竞争力的性能,在更大规模数据集上优于基线模型。
We propose two models for a special case of authorship verification problem. The task is to investigate whether the two documents of a given pair are written by the same author. We consider the authorship verification problem for both small and large scale datasets. The underlying small-scale problem has two main challenges: First, the authors of the documents are unknown to us because no previous writing samples are available. Second, the two documents are short (a few hundred to a few thousand words) and may differ considerably in the genre and/or topic. To solve it we propose transformation encoder to transform one document of the pair into the other. This document transformation generates a loss which is used as a recognizable feature to verify if the authors of the pair are identical. For the large scale problem where various authors are engaged and more examples are available with larger length, a parallel recurrent neural network is proposed. It compares the language models of the two documents. We evaluate our methods on various types of datasets including Authorship Identification datasets of PAN competition, Amazon reviews, and machine learning articles. Experiments show that both methods achieve stable and competitive performance compared to the baselines.
研究动机与目标
- 解决在缺乏作者先前写作样本的情况下进行作者身份验证的问题,尤其针对短篇、类型多样的文档。
- 克服因训练数据有限、文档长度短以及主题/类型差异带来的小规模作者身份验证挑战。
- 开发适用于大规模数据集的可扩展神经网络模型,涵盖多样化的作者和更长的文档。
- 在包括 PAN 竞赛、Amazon 评论和科技论文在内的多样化数据集上评估模型。
- 使用摘要向量和标准机器学习相似性度量建立强基线,以实现公平比较。
提出的方法
- 提出一种转换编码器(TE),通过学习从一个文档重建另一个文档,将重建损失用作作者身份验证的判别性特征。
- 在 TE 生成的误差向量上训练分类器(NB 或 DT),以区分同作者与不同作者的文档对。
- 设计一种并行循环神经网络(PRNN),将两个输入文档分别编码为独立的 RNN 隐状态,并通过融合层比较其语言模型。
- 使用摘要向量将二元作者身份验证任务转化为标准的二分类格式,以供基线比较。
- 通过将长文档分割为等长的句子部分实施数据增强,以提高小规模数据集上的训练稳定性。
- 采用 t-SNE 可视化分析 PRNN 融合层输出的决策边界分离情况。
实验结果
研究问题
- RQ1当缺乏先前写作样本时,神经转换模型能否有效学习作者相似性?
- RQ2文档转换中的重建损失与传统相似性度量在作者身份验证中相比如何?
- RQ3并行 RNN 架构能否有效学习并比较文档对的语言模型,以实现大规模作者身份验证?
- RQ4PRNN 在包括评论和科技文章在内的多样化领域中是否具有良好的泛化能力?
- RQ5所提出的模型在小规模和大规模作者身份验证基准上相对于现有基线的表现如何?
主要发现
- 转换编码器(TE)在所有四个 PAN 数据集上均表现出稳定性能,无论数据集规模、类型或主题差异如何。
- PRNN 在 Amazon 评论数据集上优于所有基线模型,达到最高准确率,且该表现与更大的训练数据量相关。
- 在 PAN2013 和 PAN2014E 上,PRNN 达到第二高准确率,通过文档分割和数据增强有效缓解了训练不稳定性。
- t-SNE 可视化显示,正样本和负样本在大多数区域可分隔,但少数区域存在重叠,表明可能存在误分类情况。
- SVM 在基于 TE 的分类中表现劣于 NB 和 DT,可能是因为其在低维误差向量(≤7 个特征)上表现不佳。
- 在足够大的训练数据下,PRNN 模型避免了过拟合,展现出在大规模数据集上的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。