Skip to main content
QUICK REVIEW

[论文解读] Beyond Black Box AI-Generated Plagiarism Detection: From Sentence to Document Level

Mujahid Quidwai, Chunhui Li|arXiv (Cornell University)|Jun 13, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种透明的、基于自然语言处理(NLP)的方法,通过生成改写问题并利用对比损失比较学生回答与大型语言模型(LLM)生成答案之间的句子级嵌入,实现对学术写作中AI生成文本的检测。该方法在区分人类与AI生成文本方面达到94%的准确率,并提供可解释、可量化的句子级指标,减少误报,消除现有工具的黑箱特性。

ABSTRACT

The increasing reliance on large language models (LLMs) in academic writing has led to a rise in plagiarism. Existing AI-generated text classifiers have limited accuracy and often produce false positives. We propose a novel approach using natural language processing (NLP) techniques, offering quantifiable metrics at both sentence and document levels for easier interpretation by human evaluators. Our method employs a multi-faceted approach, generating multiple paraphrased versions of a given question and inputting them into the LLM to generate answers. By using a contrastive loss function based on cosine similarity, we match generated sentences with those from the student's response. Our approach achieves up to 94% accuracy in classifying human and AI text, providing a robust and adaptable solution for plagiarism detection in academic settings. This method improves with LLM advancements, reducing the need for new model training or reconfiguration, and offers a more transparent way of evaluating and detecting AI-generated text.

研究动机与目标

  • 为应对大型语言模型(LLMs)兴起所导致的学术环境中AI生成抄袭行为日益增长的挑战。
  • 克服现有AI文本检测工具的局限性,包括高误报率、黑箱决策过程以及缺乏可解释性。
  • 开发一种可提供可量化、句子级指标的方法,使人工评估者能够理解和验证检测结果。
  • 构建一种检测系统,可在大型语言模型持续演进的过程中保持有效性,而无需重新训练或重新配置。

提出的方法

  • 该方法使用最先进的改写模型生成给定输入问题的多个改写版本。
  • 将每个改写后的问题输入大型语言模型(LLM),生成相应的答案,从而创建多样化的参考响应。
  • 使用预训练的嵌入模型从学生回答和LLM生成的答案中提取句子嵌入。
  • 基于余弦相似度应用对比损失函数,匹配学生回答与LLM回答之间的对应句子,实现在细粒度层面的比较。
  • 模型在句子级别计算相似度得分,从而实现透明、可解释的AI生成内容检测。
  • 该方法可适配多种LLM,包括GPT-3.5、BardAI和Character.AI,且在模型演进过程中无需重新训练。

实验结果

研究问题

  • RQ1基于学生回答与LLM生成答案之间句子级嵌入的对比,能否提升AI生成文本检测的准确率与透明度?
  • RQ2使用改写提示如何增强AI文本检测在多样化输入变化下的鲁棒性与泛化能力?
  • RQ3对比学习结合余弦相似度在多大程度上能提升对模仿人类写作的细微AI生成内容的检测能力?
  • RQ4该方法是否能在不重新训练的前提下,保持在不同LLM上的高性能,确保随模型演进而长期有效?
  • RQ5句子级相似度得分的可解释性在多大程度上能减少误报,并支持人工评估者在学术抄袭检测中的判断?

主要发现

  • 所提出的方法在HC3数据集上对人类生成与AI生成的回答区分准确率达到94%。
  • 基于上下文嵌入余弦相似度计算的句子级相似度得分,为人工评估者提供了可量化且可解释的指标。
  • 该方法通过实现细粒度、基于证据的对比,显著减少了误报,避免依赖不透明的模型预测。
  • 该方法在不同LLM(包括GPT-3.5和更新模型)上均保持有效性,无需重新训练或重新配置。
  • 使用改写提示增加了参考响应的多样性,提升了检测对学生成文变化的鲁棒性。
  • 该方法通过揭示底层的句子级对比与相似度得分,成功消除了现有检测工具的黑箱特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。