Skip to main content
QUICK REVIEW

[论文解读] TOPFORMER: Topology-Aware Authorship Attribution of Deepfake Texts with Diverse Writing Styles

Adaku Uchendu, Thái Hoàng Lê|arXiv (Cornell University)|Sep 22, 2023
Authorship Attribution and Profiling被引用 4
一句话总结

该论文提出TopRoBERTa,一种混合深度学习模型,将拓扑数据分析(TDA)整合到RoBERTa中,以提升深度伪造文本的多类别作者归属识别性能。通过从模型的池化输出中提取拓扑特征,TopRoBERTa在异质且类别不平衡的数据集上,Macro F1得分最高提升7%,优于原始RoBERTa和高斯增强基线模型。

ABSTRACT

Recent advances in Large Language Models (LLMs) have enabled the generation of open-ended high-quality texts, that are non-trivial to distinguish from human-written texts. We refer to such LLM-generated texts as deepfake texts. There are currently over 72K text generation models in the huggingface model repo. As such, users with malicious intent can easily use these open-sourced LLMs to generate harmful texts and dis/misinformation at scale. To mitigate this problem, a computational method to determine if a given text is a deepfake text or not is desired--i.e., Turing Test (TT). In particular, in this work, we investigate the more general version of the problem, known as Authorship Attribution (AA), in a multi-class setting--i.e., not only determining if a given text is a deepfake text or not but also being able to pinpoint which LLM is the author. We propose TopFormer to improve existing AA solutions by capturing more linguistic patterns in deepfake texts by including a Topological Data Analysis (TDA) layer in the Transformer-based model. We show the benefits of having a TDA layer when dealing with imbalanced, and multi-style datasets, by extracting TDA features from the reshaped $pooled\_output$ of our backbone as input. This Transformer-based model captures contextual representations (i.e., semantic and syntactic linguistic features), while TDA captures the shape and structure of data (i.e., linguistic structures). Finally, TopFormer, outperforms all baselines in all 3 datasets, achieving up to 7\% increase in Macro F1 score. Our code and datasets are available at: https://github.com/AdaUchendu/topformer

研究动机与目标

  • 应对由大型语言模型(LLMs)生成的深度伪造文本检测与归属识别日益严峻的挑战,这些文本与人工撰写内容越来越难以区分。
  • 超越二元图灵测试分类,实现多类别作者归属识别,以识别生成特定文本的具体LLM。
  • 在涉及噪声、类别不平衡和异质性文本数据的真实场景中提升模型鲁棒性,此类数据在LLM生成文本检测中极为常见。
  • 开发一种混合模型,结合RoBERTa的表征能力与拓扑数据分析(TDA)的结构敏感性,以捕捉深度伪造文本中的细微语言模式。
  • 证明从RoBERTa的池化输出中提取的TDA特征可增强模型泛化能力与性能,尤其在复杂、非均匀的数据分布中表现更优。

提出的方法

  • 微调RoBERTa-base以从输入文本中提取上下文嵌入(语义与句法特征),使用其pooled_output作为主要表征。
  • 对重塑后的pooled_output应用拓扑数据分析(TDA),以提取捕捉嵌入空间中语言模式潜在形状与结构的拓扑特征。
  • 在将输入送入最终分类头之前,将TDA特征与原始RoBERTa嵌入拼接,从而通过引入拓扑不变量有效增强模型输入。
  • 使用持久同调(persistent homology)从pooled_output计算TDA特征,使模型能够检测对噪声和分布偏移具有鲁棒性的结构模式。
  • 对样本间的TDA特征向量进行归一化,以确保维度一致并避免不稳定性,尤其在序列间特征数量不同时更为关键。
  • 将TopRoBERTa的性能与基线模型(如原始RoBERTa、Gaussian-RoBERTa)进行比较,以验证在不同数据条件下TDA层的贡献。

实验结果

研究问题

  • RQ1将拓扑数据分析(TDA)集成到RoBERTa中,是否能提升在噪声和类别不平衡数据集上对深度伪造文本的作者归属识别性能?
  • RQ2TDA层是否能增强模型在分类来自不同来源(如改写器、翻译器及多个LLM)文本时的鲁棒性?
  • RQ3TDA层带来的性能提升是源于模型固有能力,还是源于特定数据的噪声模式,特别是在异质性数据分布中?
  • RQ4与使用注意力权重相比,使用pooled_output作为TDA输入在稳定性、计算成本和分类准确率方面表现如何?
  • RQ5TopRoBERTa在分布外数据和低资源语言设置下的泛化能力如何,尤其是在对抗性条件下?

主要发现

  • TopRoBERTa在3个数据集中的2个上优于原始RoBERTa,Macro F1得分最高提升7%,尤其在异质性和多领域数据上表现突出。
  • 在包含12个类别的SynSciPass数据集(人类、生成器、翻译器、改写器)上,模型实现7%的F1得分提升,表明其在复杂标签分布中具有强大泛化能力。
  • TopRoBERTa始终优于高斯增强基线模型(Gaussian-BERT与Gaussian-RoBERTa),表明性能提升并非源于对随机噪声的适应,而是源于有意义的拓扑特征提取。
  • 从pooled_output中提取的TDA特征,相比从注意力权重中提取的特征,具有更高的稳定性和信息量;后者表现出高方差且需额外预处理。
  • PCA降维后的嵌入可视化显示,TopRoBERTa的输出中聚类更清晰、结构更分明,证实TDA增强了高维空间中特征的可分性。
  • 在同质化数据集(如人类 vs. 改写器)上,TDA层带来的增益较小,表明其主要优势在于处理异质性和复杂标签结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。