[论文解读] How Large Language Models are Transforming Machine-Paraphrased Plagiarism
本研究探讨了大型语言模型(GPT-3 和 T5)如何生成能够逃避人类识别与自动化抄袭检测工具的人类风格改写文本。研究发现,GPT-3 生成的改写文本如此逼真,以至于人类有 53% 的概率错误地将其识别为原创内容;即使先进的检测模型也难以应对——尽管 GPT-3 自身在检测其自身生成的改写文本时达到了 66% 的 F1 分数,凸显了学术诚信系统面临的严峻挑战。
The recent success of large language models for text generation poses a severe threat to academic integrity, as plagiarists can generate realistic paraphrases indistinguishable from original work. However, the role of large autoregressive transformers in generating machine-paraphrased plagiarism and their detection is still developing in the literature. This work explores T5 and GPT-3 for machine-paraphrase generation on scientific articles from arXiv, student theses, and Wikipedia. We evaluate the detection performance of six automated solutions and one commercial plagiarism detection software and perform a human study with 105 participants regarding their detection performance and the quality of generated examples. Our results suggest that large models can rewrite text humans have difficulty identifying as machine-paraphrased (53% mean acc.). Human experts rate the quality of paraphrases generated by GPT-3 as high as original texts (clarity 4.0/5, fluency 4.2/5, coherence 3.8/5). The best-performing detection model (GPT-3) achieves a 66% F1-score in detecting paraphrases.
研究动机与目标
- 探究类似 GPT-3 和 T5 的大型自回归语言模型在多大程度上能够生成在流畅性和连贯性方面与人类原创写作难以区分的改写文本。
- 评估自动化检测工具(包括 PlagScan 等商业软件和机器学习模型)在识别大型语言模型生成的改写文本方面的性能。
- 通过一项包含 105 名参与者的大型研究,评估人类识别机器生成改写文本的能力。
- 开发并公开发布一个包含来自 arXiv、Wikipedia 和学生论文的机器改写文本的公开数据集,以支持未来的研究。
提出的方法
- 微调 T5 和 GPT-3 模型,从科学论文、学生论文和 Wikipedia 条目中的原始文本生成改写内容。
- 通过不同模型规模、提示策略和选择标准生成改写示例,以确保语义一致性与词汇多样性。
- 使用六种自动化模型和一种商业工具(PlagScan)评估检测性能,比较其在识别机器改写内容方面的 F1 分数。
- 开展一项包含 105 名参与者的实验研究,评估检测准确率,并在五级量表上对生成改写文本的流畅性、清晰度和连贯性进行评分。
- 采用二分类任务评估模型区分原始文本与改写文本的能力,结果显示 GPT-3 的检测性能最高。
- 公开发布数据集、代码和研究结果,以支持未来在机器改写抄袭检测方面的研究。
实验结果
研究问题
- RQ1大型语言模型(如 GPT-3 和 T5)在流畅性和连贯性方面,能在多大程度上生成与人类原创写作难以区分的改写文本?
- RQ2当前的自动化抄袭检测工具(包括 PlagScan 和机器学习模型)在识别大型语言模型生成的改写文本方面效果如何?
- RQ3人类对机器改写文本的识别率是多少?人类判断与自动化检测系统相比表现如何?
- RQ4同一大型语言模型(如 GPT-3)能否同时用于生成和检测机器改写的抄袭文本?其性能与其他模型相比如何?
- RQ5使机器改写文本难以被检测的关键语言和结构特征是什么?这些特征能否用于改进检测方法?
主要发现
- 人类专家对 GPT-3 生成的改写文本评价显示,其清晰度(4.0/5)、流畅性(4.2/5)和连贯性(3.8/5)均较高,与原始文本相当。
- 人类在 53% 的情况下未能识别出机器改写的文本,表明区分 AI 生成的改写与原创写作存在显著困难。
- 广泛使用的商业抄袭检测工具 PlagScan 无法可靠检测出大型语言模型生成的改写文本。
- 表现最佳的自动化检测模型是 GPT-3 本身,其在识别自身生成的改写输出时达到了 66% 的 F1 分数。
- 尽管绝对性能较低,GPT-3 和 T5 在检测机器改写文本方面仍优于人类参与者,表明模型生成文本中存在可检测的统计模式。
- 本研究公开发布了来自 arXiv、Wikipedia 和学生论文的改写文本数据集,以支持未来在检测与缓解机器改写抄袭方面的工作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。