Skip to main content
QUICK REVIEW

[论文解读] Real or Fake Text?: Investigating Human Ability to Detect Boundaries Between Human-Written and Machine-Generated Text

Liam Dugan, Daphne Ippolito|arXiv (Cornell University)|Dec 24, 2022
Topic Modeling被引用 7
一句话总结

本论文研究人类在混合体裁文本中检测人工撰写与机器生成文本过渡点的能力,采用游戏化的边界检测任务。研究发现,尽管检测表现差异显著,但标注者在激励下表现有所提升,且特定文本特征(如命名实体和句子长度)与检测准确率密切相关。研究还发布了包含21,000个标注过渡点的RoFT数据集,以支持未来相关研究。

ABSTRACT

As text generated by large language models proliferates, it becomes vital to understand how humans engage with such text, and whether or not they are able to detect when the text they are reading did not originate with a human writer. Prior work on human detection of generated text focuses on the case where an entire passage is either human-written or machine-generated. In this paper, we study a more realistic setting where text begins as human-written and transitions to being generated by state-of-the-art neural language models. We show that, while annotators often struggle at this task, there is substantial variance in annotator skill and that given proper incentives, annotators can improve at this task over time. Furthermore, we conduct a detailed comparison study and analyze how a variety of variables (model size, decoding strategy, fine-tuning, prompt genre, etc.) affect human detection performance. Finally, we collect error annotations from our participants and use them to show that certain textual genres influence models to make different types of errors and that certain sentence-level features correlate highly with annotator selection. We release the RoFT dataset: a collection of over 21,000 human annotations paired with error classifications to encourage future work in human detection and evaluation of generated text.

研究动机与目标

  • 评估人类在真实混合体裁文本中检测人工撰写与机器生成文本过渡点的能力。
  • 研究模型规模、解码策略、微调方法及提示体裁等因素对人类检测表现的影响。
  • 分析错误模式及区分真实与生成文本的句子级特征。
  • 评估激励措施与经验积累是否能提升标注者在边界检测任务中的准确性。
  • 发布包含21,000个人工标注及错误分类的RoFT数据集,以支持未来关于生成文本可检测性的研究。

提出的方法

  • 本研究使用游戏化平台(RoFT)逐句向参与者展示从人工撰写过渡到机器生成的文本片段。
  • 参与者需预测过渡点并选择判断依据,评分基于其预测与真实边界之间的接近程度。
  • 数据集包含来自多种体裁(新闻、故事、演讲等)和模型配置的超过21,000个标注结果。
  • 通过统计分析比较不同模型规模、解码策略、微调方法及提示体裁下的检测准确率。
  • 收集并分析错误标注,识别与检测决策相关的语言特征(如命名实体频率、句子长度)之间的相关性。
  • 研究采用受控实验设计,通过随机化句子呈现顺序及激励机制,评估学习与表现趋势。

实验结果

研究问题

  • RQ1人类能否可靠检测混合体裁文本中人工撰写与机器生成文本的边界?个体间表现差异如何?
  • RQ2模型相关因素(如模型规模、解码策略、微调)如何影响人类检测准确率?
  • RQ3哪些句子级特征(如命名实体、词性分布、句子长度)与人类检测决策相关性最强?
  • RQ4激励措施与经验积累在多大程度上能提升人类检测文本生成边界的性能?
  • RQ5不同文本体裁(如新闻、故事、演讲)如何影响模型的错误类型及过渡点的可检测性?

主要发现

  • 标注者在检测能力上存在显著差异,但随着时间和适当激励,表现显著提升。
  • 更大的语言模型和优化的解码策略会产生更高质量的生成文本,使人类更难检测。
  • 句子中新颖命名实体的数量与检测结果密切相关:在新闻和演讲中,生成文本的此类实体少于人工文本;而在故事中则呈现相反趋势。
  • 句子长度和词性分布在真实与生成文本之间存在显著差异,且这些特征常被标注者用作判断依据。
  • RoFT数据集(包含超过21,000个标注及错误分类)已公开发布,以支持未来关于可检测性及大语言模型生成文本评估的研究。
  • 在故事和演讲中,标注者更倾向于选择命名实体数量较多的句子,但在新闻中则无此倾向,表明检测模式具有体裁依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。