[论文解读] SeqXGPT: Sentence-Level AI-Generated Text Detection
本文提出 SeqXGPT,一种新颖的句子级别人工智能生成文本检测方法,该方法利用白盒大语言模型(LLM)的词级对数概率列表作为类似波形的特征,并通过 CNN-Transformer 架构进行处理。该方法在句子级和文档级检测中均显著优于现有方法,在分布外数据上展现出强大的泛化能力。
Widely applied large language models (LLMs) can generate human-like content, raising concerns about the abuse of LLMs. Therefore, it is important to build strong AI-generated text (AIGT) detectors. Current works only consider document-level AIGT detection, therefore, in this paper, we first introduce a sentence-level detection challenge by synthesizing a dataset that contains documents that are polished with LLMs, that is, the documents contain sentences written by humans and sentences modified by LLMs. Then we propose extbf{Seq}uence extbf{X} (Check) extbf{GPT}, a novel method that utilizes log probability lists from white-box LLMs as features for sentence-level AIGT detection. These features are composed like extit{waves} in speech processing and cannot be studied by LLMs. Therefore, we build SeqXGPT based on convolution and self-attention networks. We test it in both sentence and document-level detection challenges. Experimental results show that previous methods struggle in solving sentence-level AIGT detection, while our method not only significantly surpasses baseline methods in both sentence and document-level detection challenges but also exhibits strong generalization capabilities.
研究动机与目标
- 为解决当前方法仅关注文档级检测而缺乏细粒度句子级人工智能生成文本(AIGT)检测的空白。
- 引入一个新的基准数据集,其中包含混合了人工撰写与大语言模型修改的句子的文档,以模拟现实世界中人工智能辅助写作的场景。
- 开发一种鲁棒且可泛化的检测模型,即使在输入长度较短的情况下,也能在句子级别识别人工智能生成的内容。
- 克服现有方法的局限性,例如监督模型的过拟合问题以及在短文本上的表现不佳。
提出的方法
- 该方法从白盒大语言模型中提取词级对数概率作为基础特征,并将其视为时间序列般的波形信号。
- 采用卷积神经网络(CNN)从波形对数概率序列中提取局部化、集中的特征。
- 在 CNN 之后应用自注意力(Transformer)模块,以建模特征表示中的长距离依赖关系与上下文关联。
- 使用序列标注预测每个词的来源(人工或 AI),并以最频繁的标签作为句子级别的分类结果。
- 该架构在混合人工-AI 文档的合成数据集上,通过交叉熵损失进行端到端训练。
- 该方法在句子级与文档级检测任务上均进行评估,包括分布外泛化能力测试。
实验结果
研究问题
- RQ1模型能否在输入序列短、上下文有限的句子级检测中有效识别人工智能生成的内容?
- RQ2与文档级检测相比,现有 AIGT 检测方法在应用于句子级检测时,性能下降程度如何?
- RQ3在一种大语言模型(如 GPT-3.5-turbo)上训练的模型,能在多大程度上泛化到检测其他大语言模型生成的句子或未见领域中的句子?
- RQ4对数概率特征在句子级别区分人工智能生成文本与人工撰写文本中起到何种作用?
- RQ5CNN 和 Transformer 层等架构组件如何共同提升模型识别生成文本中细微统计差异的能力?
主要发现
- SeqXGPT 在句子级 AIGT 检测中显著优于基线方法(如 DetectGPT 和 Sniffer),后者因输入长度短且缺乏细粒度建模而表现不佳。
- 该模型在文档级检测中也表现出色,表明其在不同输入尺度下均具有鲁棒性。
- SeqXGPT 在分布外数据集上展现出优越的泛化能力,即使在检测未见过的大语言模型或领域生成的句子时,仍能保持高准确率。
- 消融实验表明,CNN 对从高度相关、低维的对数概率波形中提取有意义特征至关重要,而仅使用 Transformer 无法有效学习这些稀疏特征。
- 结合 CNN 与 Transformer 组件可获得最佳性能,其中 CNN 负责提取局部模式,而 Transformer 负责建模上下文依赖关系。
- 该方法依赖白盒对数概率,实现了高度可解释性,并避免了对语义模式的过拟合,这与 RoBERTa 微调等纯语义基模型不同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。