[論文レビュー] Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore
本稿では、文法誤り訂正を用いて人間が書いた文章とモデルが生成した文章を区別するブラックボックスゼロショット検出手法であるGECScoreを提案する。事前学習済みの文法誤り訂正モデルを用いて、元の文章と文法的に訂正されたバージョンの類似度を計算することで、GECScoreは平均98.7%のAUROCを達成し、再表現や敵対的攻撃に対しても強い耐性を示す。
The efficacy of detectors for texts generated by large language models (LLMs) substantially depends on the availability of large-scale training data. However, white-box zero-shot detectors, which require no such data, are limited by the accessibility of the source model of the LLM-generated text. In this paper, we propose a simple yet effective black-box zero-shot detection approach based on the observation that, from the perspective of LLMs, human-written texts typically contain more grammatical errors than LLM-generated texts. This approach involves calculating the Grammar Error Correction Score (GECScore) for the given text to differentiate between human-written and LLM-generated text. Experimental results show that our method outperforms current state-of-the-art (SOTA) zero-shot and supervised methods, achieving an average AUROC of 98.62% across XSum and Writing Prompts dataset. Additionally, our approach demonstrates strong reliability in the wild, exhibiting robust generalization and resistance to paraphrasing attacks. Data and code are available at: https://github.com/NLP2CT/GECScore.
研究の動機と目的
- ソースLLMへのアクセスを必要としたり、再表現や敵対的入力に対して脆弱な既存のゼロショット検出手法の限界を解消すること。
- 特に分布外設定において、大規模な訓練データや微調整済み分類器に依存する監視学習手法の依存を克服すること。
- ソースモデルに依存しないブラックボックス検出アプローチを構築し、未知またはブラックボックスなLLMが使用される実世界のシナリオへの導入を可能にすること。
- 人間が書いた文章にはLLM出力よりも文法的誤りがより多いという認知的洞察を活用し、頑健な検出信号を設計すること。
- モデル固有のアクセスや膨大なデータ収集を必要とせず、最先端のゼロショット検出性能を達成すること。
提案手法
- 事前学習済みの文法誤り訂正(GEC)モデルを用いて、入力テキストとその文法的に訂正されたバージョンの類似度を計算する検出フレームワークGECScoreを提案する。
- BLEU、TER、chrF、編集距離、ROUGE、METEOR、BLEURTなどの類似度指標を用いて、元のテキストと訂正済みテキスト間のテクスト類似度を測定する。
- 類似度スコアをソフトマックススケーリングすることで、人間が書いた文章とLLM生成文章の差を明確にし、類似度が高いほどLLM生成の可能性が高くなるようにする。
- ソフトマックススケーリングされたスコアに閾値εを設定し、スコアがεを超える場合、テキストをLLM生成と分類する。
- LLMのログティクス、重み、訓練データへのアクセスを一切不要とするブラックボックス設定で動作するため、普遍的に適用可能である。
- 作業記憶理論と認知心理学の知見を活用し、人間が書いた文章にはLLM出力よりも文法的誤りの頻度が高いという仮説を裏付ける。

実験結果
リサーチクエスチョン
- RQ1ソースLLMへのアクセスや大規模な訓練データを必要としないブラックボックスゼロショット検出手法を設計できるか?
- RQ2LLM生成テキストが人間が書いたテキストよりも文法的に正確であるという特徴が、ゼロショット検出に信頼性のあるシグナルを提供するか?
- RQ3文法訂正に基づく類似度スコアは、多様なテキストタイプや分布に対して、人間とLLM生成テキストを効果的に区別できるか?
- RQ4本手法は、既存の検出器を回避する再表現や敵対的摂動に対してどれほど耐性を示すか?
- RQ5本手法は、AUROCと一般化性能の面で、最先端のゼロショットおよび監視学習検出手法を上回ることができるか?
主な発見
- GECScoreは複数のベンチマークで平均98.7%のAUROCを達成し、現在の最先端のゼロショットおよび監視学習手法を上回る性能を示した。
- 本手法は再表現攻撃に対しても強く、入力テキストが再表現されても高い検出精度を維持した。
- GECScoreは敵対的摂動に対しても効果的であり、他の検出器が失敗する状況でも耐性を示した。
- 本手法は完全にブラックボックスである。LLMの重み、ログティクス、微調整済み分類器へのアクセスは一切不要である。
- 計算効率が高くスケーラブルであり、事前学習済みGECモデルと標準的なテキスト類似度指標のみに依存する。
- GECScoreの優位性は、認知心理学と作業記憶制約に基づく根本的な言語的シグナル、すなわち文法的誤り頻度に起因する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。