[论文解读] Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore
本文提出 GECScore,一种用于检测大语言模型生成文本的黑盒零样本检测器,通过语法纠错来区分人类撰写与模型生成的文本。通过使用预训练的语法纠错模型计算原始文本与语法修正后版本之间的相似度,GECScore 在平均 AUROC 上达到 98.7%,并展现出对改写和对抗性攻击的强大鲁棒性。
The efficacy of detectors for texts generated by large language models (LLMs) substantially depends on the availability of large-scale training data. However, white-box zero-shot detectors, which require no such data, are limited by the accessibility of the source model of the LLM-generated text. In this paper, we propose a simple yet effective black-box zero-shot detection approach based on the observation that, from the perspective of LLMs, human-written texts typically contain more grammatical errors than LLM-generated texts. This approach involves calculating the Grammar Error Correction Score (GECScore) for the given text to differentiate between human-written and LLM-generated text. Experimental results show that our method outperforms current state-of-the-art (SOTA) zero-shot and supervised methods, achieving an average AUROC of 98.62% across XSum and Writing Prompts dataset. Additionally, our approach demonstrates strong reliability in the wild, exhibiting robust generalization and resistance to paraphrasing attacks. Data and code are available at: https://github.com/NLP2CT/GECScore.
研究动机与目标
- 解决现有零样本检测器依赖源大语言模型访问权限或对改写及对抗性输入敏感的局限性。
- 克服监督方法中对大规模训练数据或微调分类器的依赖,尤其在分布外设置下表现更优。
- 开发一种不依赖源模型的黑盒检测方法,实现对未知或黑盒大语言模型的实际部署。
- 利用认知洞察:人类撰写文本中的语法错误多于大语言模型生成的文本,从而设计出鲁棒的检测信号。
- 在无需模型特定访问权限或大规模数据收集的前提下,实现最先进的零样本检测性能。
提出的方法
- 提出 GECScore,一种检测框架,利用预训练的语法纠错(GEC)模型计算输入文本与其语法修正版本之间的相似度。
- 应用相似度度量(如 BLEU、TER、chrF、编辑距离、ROUGE、METEOR、BLEURT)来衡量原始文本与修正文本之间的文本相似度。
- 使用 softmax 缩放的相似度分数以增强人类撰写与大语言模型生成文本之间的区分度,相似度越高表示越可能为模型生成。
- 在 softmax 缩放分数上设定阈值 ε;若分数超过 ε,则将文本分类为大语言模型生成。
- 在黑盒设置下运行——无需访问大语言模型的 logits、权重或训练数据,从而具备普遍适用性。
- 利用工作记忆理论和认知心理学洞见,支持人类撰写文本的语法错误率高于大语言模型输出的假设。

实验结果
研究问题
- RQ1能否设计一种黑盒零样本检测器,无需访问源大语言模型或大规模训练数据?
- RQ2与人类撰写文本相比,大语言模型生成文本的固有语法准确性是否可作为零样本检测的可靠信号?
- RQ3基于语法纠错的相似度分数是否能有效区分不同文本类型和分布下的人类与大语言模型生成的文本?
- RQ4该方法对可规避现有检测器的改写和对抗性扰动的鲁棒性如何?
- RQ5该方法能否在 AUROC 和泛化能力方面超越最先进的零样本及监督检测方法?
主要发现
- GECScore 在多个基准测试中平均 AUROC 达到 98.7%,优于当前最先进的零样本和监督方法。
- 该方法对改写攻击表现出强大鲁棒性,在输入文本被重述时仍能保持高检测准确率。
- GECScore 对对抗性扰动保持有效,展现出在其他检测器失效时的抗干扰能力。
- 该方法完全为黑盒:无需访问大语言模型的权重、logits 或微调分类器。
- 该方法计算效率高且可扩展,仅依赖预训练的 GEC 模型和标准文本相似度度量。
- GECScore 的优越性归因于其基于根本语言信号——语法错误频率——的机制,该信号源于认知心理学和工作记忆限制。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。