[論文レビュー] Real or Fake Text?: Investigating Human Ability to Detect Boundaries Between Human-Written and Machine-Generated Text
本稿は、ゲーム化された境界検出タスクを用いて、混合ジャンルの文章において人間が人間が書いた文章と機械生成された文章の遷移点を検出できる能力を調査している。検出性能には個人差が大きくみられるが、報酬の有無や特定の文脈的特徴(例:固有表現の頻度、文の長さ)があると検出精度が向上する。また、21,000件のアノテーションがなされたRoFTデータセットを公開し、将来的な研究を支援する。
As text generated by large language models proliferates, it becomes vital to understand how humans engage with such text, and whether or not they are able to detect when the text they are reading did not originate with a human writer. Prior work on human detection of generated text focuses on the case where an entire passage is either human-written or machine-generated. In this paper, we study a more realistic setting where text begins as human-written and transitions to being generated by state-of-the-art neural language models. We show that, while annotators often struggle at this task, there is substantial variance in annotator skill and that given proper incentives, annotators can improve at this task over time. Furthermore, we conduct a detailed comparison study and analyze how a variety of variables (model size, decoding strategy, fine-tuning, prompt genre, etc.) affect human detection performance. Finally, we collect error annotations from our participants and use them to show that certain textual genres influence models to make different types of errors and that certain sentence-level features correlate highly with annotator selection. We release the RoFT dataset: a collection of over 21,000 human annotations paired with error classifications to encourage future work in human detection and evaluation of generated text.
研究の動機と目的
- 現実的で混合ジャンルの文章において、人間が人間が書いた文章と機械生成された文章の遷移点を検出できる能力を評価すること。
- モデルのサイズ、デコード戦略、ファインチューニング、プロンプトのジャンルといった要因が、人間の検出性能に与える影響を調査すること。
- 本物の文章と生成された文章を区別する文レベルの特徴(例:誤りのパターン、文の長さ)を分析すること。
- 報酬や経験の有無が、境界検出タスクにおけるアノテーターの正確性にどの程度向上効果をもたらすかを評価すること。
- 21,000件の人的アノテーションと誤り分類がなされたRoFTデータセットを公開し、生成テキストの検出可能性に関する将来的な研究を可能にすること。
提案手法
- 研究は、人間が書いた文章から機械生成された文章に遷移する文章の一部を、1文ずつ提示するゲーム化されたプラットフォーム(RoFT)を用いる。
- 参加者は遷移点を予測し、その根拠を選び、真の境界に近いほど高いスコアが得られる。
- データセットには、新聞、物語、演説など多様なジャンルとモデル設定で得られた21,000件以上のアノテーションが含まれる。
- 統計的分析により、モデルのサイズ、デコード戦略、ファインチューニング、プロンプトのジャンルごとの検出精度を比較する。
- 誤りのアノテーションを収集・分析し、固有表現の頻度や文の長さといった言語的特徴が検出意思決定とどの程度相関するかを特定する。
- ランダムに文を提示し、報酬構造を変更する制御された実験デザインを採用し、学習と性能の傾向を評価する。
実験結果
リサーチクエスチョン
- RQ1人間は混合文章において、人間が書いた文章と機械生成された文章の境界を信頼性を持って検出できるのか。また、個人差はどの程度あるのか。
- RQ2モデル固有の要因(例:モデルのサイズ、デコード戦略、ファインチューニング)が人間の検出精度に与える影響は何か。
- RQ3文レベルの特徴(例:固有表現、品詞分布、文の長さ)の中で、人間の検出意思決定と最も強く相関するのはどれか。
- RQ4報酬や経験の有無が、テキスト生成境界の検出における人間の性能向上にどの程度寄与するか。
- RQ5異なるテキストジャンル(例:新聞、物語、演説)が、モデルが犯す誤りの種類や境界の検出可能性にどのように影響するか。
主な発見
- アノテーターの検出能力には顕著な個人差があり、経験を積むことと適切な報酬の有無で性能が著しく向上する。
- 大規模言語モデルと最適化されたデコード戦略は、より高品質な生成を生み出し、人間が検出しにくくする。
- 文に含まれる新しい固有表現の数が検出に強く関連している。新聞や演説では、生成された文の固有表現の数が人間が書いた文より少ないが、物語では逆の傾向が見られる。
- 文の長さや品詞分布の違いも本物と生成された文章の間で有意に認められ、これらはアノテーターが意思決定に頻繁に使用する手がかりである。
- 21,000件以上の人的アノテーションと誤り分類がなされたRoFTデータセットは、生成テキストの検出可能性に関する将来的な研究を支援する目的で公開された。
- 物語や演説では、固有表現の数が多い文を選ぶ傾向があるが、新聞ではその傾向は見られない。これはジャンル依存の検出パターンを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。