Skip to main content
QUICK REVIEW

[論文レビュー] HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus

Zhenpeng Su, Xing Wu|arXiv (Cornell University)|Sep 6, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、要約、翻訳、並び替えなど意味的恒等的タスクを含む大規模かつタスクに多様性を持つHC3の拡張版であるHC3 Plusを紹介する。これらのタスクでは、ChatGPTが生成したテキストを検出することが著しく困難になる。著者らは、HC3 Plusで微調整されたT k -instructベースのモデルを用いて、InstructDGGCと呼ばれる検出システムを構築した。このシステムは、英語データではRoBERTaベースラインより1.8%、中国語データでは0.58%優れている。これは、意味的恒等的コンテンツに対してより高い耐性を示していることを示している。

ABSTRACT

ChatGPT has garnered significant interest due to its impressive performance; however, there is growing concern about its potential risks, particularly in the detection of AI-generated content (AIGC), which is often challenging for untrained individuals to identify. Current datasets used for detecting ChatGPT-generated text primarily focus on question-answering tasks, often overlooking tasks with semantic-invariant properties, such as summarization, translation, and paraphrasing. In this paper, we demonstrate that detecting model-generated text in semantic-invariant tasks is more challenging. To address this gap, we introduce a more extensive and comprehensive dataset that incorporates a wider range of tasks than previous work, including those with semantic-invariant properties. In addition, instruction fine-tuning has demonstrated superior performance across various tasks. In this paper, we explore the use of instruction fine-tuning models for detecting text generated by ChatGPT.

研究の動機と目的

  • 質問への回答中心のタスクに焦点を当てた既存のデータセットの欠落を補い、要約、翻訳、並び替えのような意味的恒等的タスクを無視している点を是正すること。
  • 入力の意味を正確に保持する必要がある意味的恒等的タスクにおけるLLM生成テキストの検出の難易度を調査すること。
  • 多様で意味的に制約のあるタスクに一般化できる、より耐性のある検出システムの開発。
  • 英語および中国語の複数の意味的恒等的タスクをカバーする、より大規模かつ包括的なデータセットを用いてHC3ベンチマークを拡張すること。
  • 多様なNLPタスクにおけるAIGC検出において、指示微調整モデルのゼロショットまたはフェイントショット一般化の有効性を評価すること。

提案手法

  • 著者らは、要約(CNN/DailyMail)、翻訳(WMT’19)、並び替え(HC3-Paraphrase)のための人的アノテーションデータを収集し、同じ入力を用いてChatGPTでモデル出力を生成した。
  • これら新規の意味的恒等的タスクデータと元のHC3データセットを統合することで、検出用のより大規模でマルチタスクのベンチマークであるHC3 Plusを構築した。
  • 著者らは、757件の英語タスクでT k -instruct-baseモデルを微調整し、さらにSuper-NaturalInstructions(24件の中国語タスクを含む)で微調整した後、英語および中国語の両方でHC3 Plusで再微調整した。
  • 2つの検出器を訓練した:RoBERTa-HC3 Plus(HC3 Plusでのみ微調整済み)とInstructDGGC(HC3 Plusで指示微調整により訓練された生成的検出器)。
  • テストセットにおける精度、再現率、正答率を用いて検出性能を評価し、QA、要約、翻訳、並び替えタスクの間で結果を比較した。
  • 既存の検出器(例:chatgpt-detector-RoBERTa)をベースラインとして用い、意味的恒等的出力の検出の難易度を検証した。
Figure 1: Examples of QA and summarization, the same color indicates fragments that appear in both source and target sentences.
Figure 1: Examples of QA and summarization, the same color indicates fragments that appear in both source and target sentences.

実験結果

リサーチクエスチョン

  • RQ1QAタスクと比較して、要約、翻訳、並び替えのような意味的恒等的タスクに既存のAIGC検出器を適用した場合、性能はどの程度低下するか?
  • RQ2HC3 Plusのような多様でマルチタスクのデータセットで訓練された検出器は、さまざまな意味的恒等的NLPタスクに一般化する能力をどの程度向上させるか?
  • RQ3多数の多様なタスクで指示微調整を施すことで、LLM生成テキストを識別する検出モデルの耐性と一般化能力は向上するか?
  • RQ4RoBERTa-HC3 Plusは、翻訳データでは要約や並び替えよりも性能が悪いが、これはより多くの訓練データを使用しているにもかかわらずなぜか?
  • RQ5生成的検出モデル(InstructDGGC)は、意味的恒等的タスクにおいて、判別的RoBERTaベースの検出器と比較してどの程度優れているか?

主な発見

  • 要約や並び替えのような意味的恒等的タスクにおける検出性能は、QAタスクよりも著しく低い。RoBERTa-HC3は人間が書いたテキストの再現率は高いが、ChatGPTが生成したテキストの再現率は低く、CNN/DailyMailでは顕著である。
  • RoBERTa-HC3 Plusは、意味的恒等的タスクにおける検出性能をRoBERTa-HC3より向上させたが、出力が参照文と非常に似通っている翻訳データでは依然として困難を抱えている。
  • InstructDGGCは、英語ではRoBERTa-HC3 Plusより1.8%、中国語では0.58%優れている。これは、多様なタスクで指示微調整を行うことで、検出一般化に利益が得られることを示している。
  • RoBERTa-HC3とRoBERTa-HC3 Plusの性能差は、タスク固有の検出器が混合データで訓練されたマルチタスク検出器よりも一般化能力に優れている可能性を示唆している。
  • 中国語の翻訳データにおける検出器の性能不良は、中国語タスクでの指示微調整がボトルネックに留まっていることを示しており、おそらく高品質な指示データが不足しているためである。
  • 結果は、意味的恒等的タスクがAIGC検出においてより大きな挑戦をもたらすという仮説を検証しており、モデル出力が人間の参照と類似しており、区別が困難であるためである。
Figure 2: Examples of translation, summary generation, and paraphrasing in HC3-SI
Figure 2: Examples of translation, summary generation, and paraphrasing in HC3-SI

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。