Skip to main content
QUICK REVIEW

[论文解读] Classification of Human- and AI-Generated Texts: Investigating Features for ChatGPT

Lorenz Mindner, Tim Schlippe|arXiv (Cornell University)|Aug 10, 2023
Text Readability and Simplification参考文献 27被引用 6
一句话总结

本文提出了一种新颖的分类框架,通过使用一系列传统与新型特征(包括困惑度、语义相似度、列表查找、基于错误的度量、可读性、AI反馈以及文本向量)来检测人类生成和AI生成的文本。最佳系统在高级AI生成文本上的F1得分达到96.9%,在AI重述文本上的F1得分为81.7%,相较于GPTZero在基础重述检测任务中相对提升了183.8%的F1得分。

ABSTRACT

Recently, generative AIs like ChatGPT have become available to the wide public. These tools can for instance be used by students to generate essays or whole theses. But how does a teacher know whether a text is written by a student or an AI? In our work, we explore traditional and new features to (1) detect text generated by AI from scratch and (2) text rephrased by AI. Since we found that classification is more difficult when the AI has been instructed to create the text in a way that a human would not recognize that it was generated by an AI, we also investigate this more advanced case. For our experiments, we produced a new text corpus covering 10 school topics. Our best systems to classify basic and advanced human-generated/AI-generated texts have F1-scores of over 96%. Our best systems for classifying basic and advanced human-generated/AI-rephrased texts have F1-scores of more than 78%. The systems use a combination of perplexity, semantic, list lookup, error-based, readability, AI feedback, and text vector features. Our results show that the new features substantially help to improve the performance of many classifiers. Our best basic text rephrasing detection system even outperforms GPTZero by 183.8% relative in F1-score.

研究动机与目标

  • 为应对教育环境中检测AI生成及AI重述学生文本日益严峻的挑战。
  • 探究除传统特征(如困惑度和突发性)之外,新型特征(如列表查找、基于错误的度量和AI反馈)的有效性。
  • 开发并评估一种针对基础与高级AI文本生成及重述任务均具有鲁棒性和泛化能力的检测系统。
  • 为未来AI文本检测研究提供公开可用的高质量语料库。
  • 与现有工具(如GPTZero)进行基准对比,展示更高的检测准确率。

提出的方法

  • 作者构建了一个新的、公开共享的语料库,包含500篇涵盖10个学校主题的文章,分别标注为人类生成或AI生成及重述。
  • 他们设计了一套全面的特征:困惑度、语义相似度、列表查找(包括标题重复)、基于错误的度量(如语法错误)、可读性评分、AI反馈信号以及文本向量表示。
  • 训练并评估了多种分类器(XGBoost、随机森林和多层感知机)在不同特征组合上的表现。
  • 该研究系统比较了包含传统与新引入特征的特征集,以分离其对检测性能的影响。
  • 性能通过准确率和F1得分进行衡量,并与GPTZero作为基线进行对比。
  • 表现最佳的模型结合了所有特征类别,表明特征多样性可显著提升检测的鲁棒性。
Figure 3: $PPL_{mean}$ Distribution.
Figure 3: $PPL_{mean}$ Distribution.

实验结果

研究问题

  • RQ1在高级提示策略下,传统特征与新型特征在区分人类生成与AI生成文本方面的有效性如何?
  • RQ2诸如列表查找、基于错误的度量和AI反馈等特征,在超越标准度量(如困惑度和突发性)的基础上,能在多大程度上提升检测性能?
  • RQ3检测系统能否在检测AI重述文本方面超越现有工具(如GPTZero)?
  • RQ4检测模型在基础与高级文本生成及重述场景下的性能表现有何差异?
  • RQ5各类特征对整体分类性能的相对贡献如何?

主要发现

  • 在检测高级AI生成文本方面,最佳系统达到96.9%的F1得分,表明其在区分复杂AI输出方面具有高度可靠性。
  • 对于AI重述文本,最佳系统达到81.7%的F1得分,显著优于GPTZero的45.8% F1得分。
  • 在基础文本重述检测方面,最佳系统相较GPTZero实现了183.8%的相对F1得分提升。
  • 引入新型特征(尤其是列表查找和AI反馈)在所有设置下均显著提升了检测性能。
  • 文本向量和文档级特征是最具预测力的特征,而基于错误的特征则表现出中等但稳定的增益。
  • 系统在各类分类器上表现稳健,当使用完整特征集时,XGBoost、随机森林和MLP的性能表现相当。
Figure 4: $sentiment_{subjectivity}$ Distribution.
Figure 4: $sentiment_{subjectivity}$ Distribution.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。