Skip to main content
QUICK REVIEW

[論文レビュー] GPT-who: An Information Density-based Machine-Generated Text Detector

Saranya Venkatraman, Adaku Uchendu|arXiv (Cornell University)|Oct 9, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

GPT-who は、微調整を必要とせず、ドメインに依存しない統計的検出器であり、均一情報密度(UID)に基づく特徴を用いて、人間と複数のLLM生成テキストを区別する心理言語学的根拠を持つ。多様なドメインやLLMをカバーする多クラス著者識別において、最先端の検出器を20%以上上回る性能を発揮し、驚異的確率に基づく特徴解析により計算効率的かつ解釈可能である。

ABSTRACT

The Uniform Information Density (UID) principle posits that humans prefer to spread information evenly during language production. We examine if this UID principle can help capture differences between Large Language Models (LLMs)-generated and human-generated texts. We propose GPT-who, the first psycholinguistically-inspired domain-agnostic statistical detector. This detector employs UID-based features to model the unique statistical signature of each LLM and human author for accurate detection. We evaluate our method using 4 large-scale benchmark datasets and find that GPT-who outperforms state-of-the-art detectors (both statistical- & non-statistical) such as GLTR, GPTZero, DetectGPT, OpenAI detector, and ZeroGPT by over $20$% across domains. In addition to better performance, it is computationally inexpensive and utilizes an interpretable representation of text articles. We find that GPT-who can distinguish texts generated by very sophisticated LLMs, even when the overlying text is indiscernible. UID-based measures for all datasets and code are available at https://github.com/saranya-venkatraman/gpt-who.

研究の動機と目的

  • 人間生成テキストの著者を、多様なLLMや執筆タスクにおいて、強力で多クラス、ドメインに依存しない検出器を開発すること。
  • 均一情報密度(UID)原則を、人間とLLM生成言語の微細な統計的差異を検出する理論的根拠に基づいた解釈可能な特徴空間として活用すること。
  • 高コストな微調整を回避しながら、高い性能を維持する計算効率の良い検出器を構築すること。特に、分布外や未観測モデル設定においても有効である。
  • UIDに基づく特徴が、視認できない差異であっても、異なるLLMファミリーと人間著者を信頼性高く区別できることを示すこと。
  • ブラックボックス型LLMベースの検出器の代替として、著者識別意思決定の背後にある驚異的確率パターンを可視化することで、意思決定プロセスの洞察を提供すること。

提案手法

  • 方法は、オフザシェル言語モデルを用いてトークンレベルの驚異的確率確率を計算し、テキスト内の情報密度の分布を反映するUID特徴を抽出する。
  • トークン確率の統計的分布から理論的に根拠を持つ解釈可能な特徴の集合を構築し、文やフレーズにわたる情報の均等な配分を捉える。
  • これらのUID特徴を学習データとして用い、ロジスティック回帰分類器を訓練し、人間著者と複数のLLMを区別する閾値を学習する。
  • 検出器は、TuringBench、GPABenchmark、ArguGPT、Deepfake Text in-the-wild の4つの大規模ベンチマークデータセット上で訓練および評価される。
  • アプローチはドメインに依存せず、タスクに依存しないため、再訓練や微調整なしに、執筆スタイル、トピック、LLMアーキテクチャの多様性に一般化可能である。
  • 驚異的確率パターンの可視化と分析により、特徴の解釈性が向上し、モデルの意思決定プロセスへの洞察が得られる。
Figure 1: GPT-who leverages psycholinguistically motivated representations that capture authors’ information signatures distinctly, even when the corresponding text is indiscernible.
Figure 1: GPT-who leverages psycholinguistically motivated representations that capture authors’ information signatures distinctly, even when the corresponding text is indiscernible.

実験結果

リサーチクエスチョン

  • RQ1均一情報密度(UID)原則は、人間生成テキストとLLM生成テキストを区別する信頼性のある統計的サインチャに適しているか?
  • RQ2UIDに基づく特徴は、モデルの微調整なしに、多様なLLMやドメインをカバーする多クラス著者識別を可能にするか?
  • RQ3人間生成テキストのUID分布は、さまざまなLLMのそれとどのように異なるのか。特に情報の配分とアーキテクチャ的類似性の観点から。
  • RQ4UIDベースの特徴は、ゼロショットおよび分布外設定において、統計的およびディープラーニングベースの検出器をどれほど上回るか?
  • RQ5語彙的・構文的兆候が区別できない状況でも、UID特徴はテキスト生成の微細な差を検出できるか?

主な発見

  • GPT-who は、GLTR、GPTZero、ZeroGPT といった最先端の統計的検出器を、全ベンチマークデータセットでF1スコアで20%以上上回る。特に、ドメイン跨ぎおよびモデル跨ぎ検出において顕著な優位性を示す。
  • Deepfake Text in-the-wild データセットでは、GPT-who は最も挑戦的な「未観測モデルかつ未観測ドメイン」設定でF1スコア0.85を達成し、GLTR(0.74)とDetectGPT(0.57)を上回る。
  • ArguGPT データセットでは、GPT-who はF1スコア0.84を達成し、人間専門家(0.51)を上回り、微調整済みRoBERTaモデルと同等の性能を示す。微調整は一切実施していない。
  • GPABenchmark データセットでは、GPT-who は7体の高度なLLMからのテキスト検出において、GPTZero、ZeroGPT、OpenAIの検出器を40%以上上回る精度を達成する。
  • 人間生成テキストは、LLMと比較して情報分布が不均一で多様である。UID特徴は、アーキテクチャ的類似性を反映しており、同じファミリーに属するモデルはUID空間で密にクラスタリングされる。
  • この方法は計算効率的かつ解釈可能であり、微調整や複雑なアーキテクチャを一切使用せず、事前学習済み言語モデルとロジスティック回帰のみで構成される。
Figure 2: GPT-who uses token probabilities of articles to extract UID-based features. A classifier then learns to map UID features to different authors, and identify the author of a new unseen article.
Figure 2: GPT-who uses token probabilities of articles to extract UID-based features. A classifier then learns to map UID features to different authors, and identify the author of a new unseen article.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。