Skip to main content
QUICK REVIEW

[论文解读] HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus

Zhenpeng Su, Xing Wu|arXiv (Cornell University)|Sep 6, 2023
Topic Modeling被引用 6
一句话总结

本文提出 HC3 Plus,一个大规模、任务多样化的数据集,扩展了 HC3,增加了语义不变任务(如摘要生成、翻译和改写),在这些任务中检测 ChatGPT 生成文本的难度显著提高。通过在 HC3 Plus 上微调基于 T k -instruct 的模型,作者开发了 InstructDGGC 检测系统,在英文数据上比 RoBERTa 基线模型高出 1.8%,在中文数据上高出 0.58%,表明其在语义不变内容上的鲁棒性有所提升。

ABSTRACT

ChatGPT has garnered significant interest due to its impressive performance; however, there is growing concern about its potential risks, particularly in the detection of AI-generated content (AIGC), which is often challenging for untrained individuals to identify. Current datasets used for detecting ChatGPT-generated text primarily focus on question-answering tasks, often overlooking tasks with semantic-invariant properties, such as summarization, translation, and paraphrasing. In this paper, we demonstrate that detecting model-generated text in semantic-invariant tasks is more challenging. To address this gap, we introduce a more extensive and comprehensive dataset that incorporates a wider range of tasks than previous work, including those with semantic-invariant properties. In addition, instruction fine-tuning has demonstrated superior performance across various tasks. In this paper, we explore the use of instruction fine-tuning models for detecting text generated by ChatGPT.

研究动机与目标

  • 为解决现有数据集主要关注问答任务、而忽视摘要生成、翻译和改写等语义不变任务的缺陷。
  • 探究在语义不变任务中检测大语言模型生成文本的难度,这些任务要求输出与输入含义完全一致。
  • 开发一种更具鲁棒性的检测系统,能够泛化到多种语义受限的任务。
  • 通过扩展 HC3 基准,构建一个更大、更全面的数据集,涵盖英文和中文的多种语义不变任务。
  • 评估指令微调模型在零样本或少样本设置下,于多样化 NLP 任务中进行 AIGC 检测的泛化能力。

提出的方法

  • 作者收集了人类标注的摘要生成(CNN/DailyMail)、翻译(WMT’19)和改写(HC3-Paraphrase)数据集,然后使用相同的输入生成模型输出(ChatGPT)。
  • 通过将这些新增的语义不变任务数据与原始 HC3 数据集结合,构建了 HC3 Plus,形成一个更大规模、多任务的检测基准。
  • 在 757 个英文任务上微调 T k -instruct-base 模型,并进一步在 Super-NaturalInstructions(包含 24 个中文任务)上微调,随后在英文和中文的 HC3 Plus 上进行微调。
  • 训练了两个检测器:RoBERTa-HC3 Plus(仅在 HC3 Plus 上训练)和 InstructDGGC(通过在 HC3 Plus 上进行指令微调训练的生成式检测器)。
  • 使用测试集上的精确率、召回率和准确率评估检测性能,并在问答、摘要生成、翻译和改写任务之间进行比较。
  • 使用现有检测器(如 chatgpt-detector-RoBERTa)作为基线,验证语义不变输出检测的难度。
Figure 1: Examples of QA and summarization, the same color indicates fragments that appear in both source and target sentences.
Figure 1: Examples of QA and summarization, the same color indicates fragments that appear in both source and target sentences.

实验结果

研究问题

  • RQ1当将现有 AIGC 检测器应用于摘要生成、翻译和改写等语义不变任务时,其性能相较于问答任务如何下降?
  • RQ2在像 HC3 Plus 这样多样化的多任务数据集上进行训练,能在多大程度上提升检测器在不同语义不变 NLP 任务中的泛化能力?
  • RQ3在大量多样化任务上进行指令微调,能否提升检测模型在识别大语言模型生成文本方面的鲁棒性和泛化能力?
  • RQ4为何 RoBERTa-HC3 Plus 在翻译数据上的表现劣于摘要生成或改写任务,尽管其训练数据更多?
  • RQ5在语义不变任务中,生成式检测模型(InstructDGGC)与判别式 RoBERTa 基检测器相比表现如何?

主要发现

  • 在摘要生成和改写等语义不变任务上的检测性能显著低于问答任务,RoBERTa-HC3 Plus 对人类撰写文本的召回率较高,但对 ChatGPT 生成文本的召回率较低,尤其在 CNN/DailyMail 数据集上表现明显。
  • RoBERTa-HC3 Plus 检测器在语义不变任务上的检测性能优于 RoBERTa-HC3,但仍最难以处理翻译数据,因为其输出与参考句高度相似。
  • InstructDGGC 在英文整体性能上比 RoBERTa-HC3 Plus 高出 1.8%,在中文上高出 0.58%,证明在多样化任务上进行指令微调有助于提升检测泛化能力。
  • RoBERTa-HC3 与 RoBERTa-HC3 Plus 之间的性能差距表明,任务特定检测器在泛化能力上优于在混合数据上训练的多任务检测器。
  • 检测器在中文翻译数据上的表现较差,表明中文任务上的指令微调仍存在瓶颈,可能由于高质量指令数据不足。
  • 结果验证了假设:语义不变任务对 AIGC 检测构成更大挑战,因为模型输出与人类参考文本更为相似,更难区分。
Figure 2: Examples of translation, summary generation, and paraphrasing in HC3-SI
Figure 2: Examples of translation, summary generation, and paraphrasing in HC3-SI

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。