Skip to main content
QUICK REVIEW

[논문 리뷰] Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore

Junchao Wu, Runzhe Zhan|arXiv (Cornell University)|2024. 05. 07.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 LLM 생성 텍스트를 식별하기 위해 문법 오류 수정을 활용하는 블랙박스 제로샷 검출기인 GECScore를 제안한다. 사전에 훈련된 문법 오류 수정 모델을 사용해 원본 텍스트와 문법적으로 수정된 버전 간의 유사도를 계산함으로써, 인간이 작성한 텍스트와 모델이 생성한 텍스트를 구분한다. GECScore는 98.7% 평균 AUROC를 달성하며, 재구성 및 악성 공격에 대해 뛰어난 강건성을 보여준다.

ABSTRACT

The efficacy of detectors for texts generated by large language models (LLMs) substantially depends on the availability of large-scale training data. However, white-box zero-shot detectors, which require no such data, are limited by the accessibility of the source model of the LLM-generated text. In this paper, we propose a simple yet effective black-box zero-shot detection approach based on the observation that, from the perspective of LLMs, human-written texts typically contain more grammatical errors than LLM-generated texts. This approach involves calculating the Grammar Error Correction Score (GECScore) for the given text to differentiate between human-written and LLM-generated text. Experimental results show that our method outperforms current state-of-the-art (SOTA) zero-shot and supervised methods, achieving an average AUROC of 98.62% across XSum and Writing Prompts dataset. Additionally, our approach demonstrates strong reliability in the wild, exhibiting robust generalization and resistance to paraphrasing attacks. Data and code are available at: https://github.com/NLP2CT/GECScore.

연구 동기 및 목표

  • 소스 LLM에 대한 액세스가 필요하거나 재구성 또는 악성 입력에 취약한 기존 제로샷 검출기의 한계를 해결한다.
  • 특히 분포 외 설정에서 큰 규모의 훈련 데이터나 미세조정된 분류기를 요구하는 감독 학습 방법에 대한 의존도를 줄인다.
  • 소스 모델에 종속되지 않는 블랙박스 검출 접근법을 개발하여, 알 수 없는 또는 블랙박스 LLM이 존재하는 실제 환경에서의 구현을 가능하게 한다.
  • 인간이 작성한 텍스트는 LLM 생성 텍스트보다 더 많은 문법 오류를 포함한다는 인지적 통찰을 활용해 강건한 검출 신호를 설계한다.
  • 모델 전용 액세스나 광범위한 데이터 수집 없이도 최신 기술 수준의 제로샷 성능을 달성한다.

제안 방법

  • 사전에 훈련된 문법 오류 수정(GEC) 모델을 사용해 입력 텍스트와 그 문법적으로 수정된 버전 간의 유사도를 계산하는 검출 프레임워크인 GECScore를 제안한다.
  • 원본 텍스트와 수정된 텍스트 간의 텍스트 유사도를 측정하기 위해 유사도 지표(예: BLEU, TER, chrF, 편집 거리, ROUGE, METEOR, BLEURT)를 적용한다.
  • softmax 스케일링된 유사도 점수를 사용해 인간이 작성한 텍스트와 LLM 생성 텍스트 간의 구분을 강화하며, 높은 유사도가 LLM 생성 가능성을 높게 나타낸다.
  • softmax 스케일링된 점수에 임계값 ε를 설정하고, 점수가 ε를 초과하면 해당 텍스트를 LLM 생성으로 분류한다.
  • 소스 LLM의 로그릿, 가중치, 훈련 데이터에 대한 액세스가 필요 없어도 작동하므로 블랙박스 환경에서 작동하며, 보편적으로 적용 가능하다.
  • 작업 기억 이론과 인지심리학적 통찰을 활용해 인간이 작성한 텍스트는 LLM 출력보다 더 높은 문법 오류 비율을 가진다는 가설을 정당화한다.
Figure 1: GECScore Framework Overview. First, a grammar correction model generates a grammatically corrected version $\tilde{x_{i}}$ of the input text $x_{i}$ . Next, the similarity score $\hat{s}_{x_{i}}$ between $\tilde{x_{i}}$ and $x_{i}$ is calculated using a similarity metric $Sim$ , and then a
Figure 1: GECScore Framework Overview. First, a grammar correction model generates a grammatically corrected version $\tilde{x_{i}}$ of the input text $x_{i}$ . Next, the similarity score $\hat{s}_{x_{i}}$ between $\tilde{x_{i}}$ and $x_{i}$ is calculated using a similarity metric $Sim$ , and then a

실험 결과

연구 질문

  • RQ1소스 LLM에 대한 액세스나 대규모 훈련 데이터가 필요 없는 블랙박스 제로샷 검출기를 설계할 수 있는가?
  • RQ2LLM 생성 텍스트는 인간이 작성한 텍스트보다 본질적으로 더 높은 문법 정확도를 가지며, 이는 제로샷 검출에 신뢰할 수 있는 신호가 될 수 있는가?
  • RQ3문법 수정 기반의 유사도 점수가 다양한 텍스트 유형과 분포에서 인간과 LLM 생성 텍스트를 효과적으로 구분할 수 있는가?
  • RQ4기존 검출기들을 피할 수 있는 재구성 및 악성 변형에 대해 제안된 방법은 얼마나 강건한가?
  • RQ5이 방법은 AUROC와 일반화 능력 측면에서 최신 기술 수준의 제로샷 및 감독 학습 검출 방법을 모두 능가할 수 있는가?

주요 결과

  • GECScore는 여러 벤치마크에서 평균 AUROC 98.7%를 달성하며, 현재 최신 기술 수준의 제로샷 및 감독 학습 방법을 초월한다.
  • 이 방법은 재구성 공격에 대해 강력한 강건성을 보이며, 입력 텍스트가 재구성되어도 높은 검출 정확도를 유지한다.
  • GECScore는 악성 변형에 대해서도 효과적이며, 다른 검출기들이 실패하는 상황에서도 내성적이다.
  • 이 방법은 완전히 블랙박스 기반이다: LLM의 가중치, 로그릿, 미세조정된 분류기가 필요하지 않다.
  • 이 방법은 계산적으로 효율적이고 확장 가능하며, 사전에 훈련된 GEC 모델과 표준 텍스트 유사도 지표만을 사용한다.
  • GECScore의 우월성은 인지심리학과 작업 기억 제약에 뿌리를 두고 있는 기본적인 언어 신호인 문법 오류 빈도에 기반한다.
Figure 2: Similarity Score Distribution for Grammatically Corrected versus Original Texts. This figure illustrates the distribution of similarity scores using the BLEURT metric for 500 human-written and GPT-3.5 generated samples from the Writing Prompts dataset. Post-softmax scaling, a marked diverg
Figure 2: Similarity Score Distribution for Grammatically Corrected versus Original Texts. This figure illustrates the distribution of similarity scores using the BLEURT metric for 500 human-written and GPT-3.5 generated samples from the Writing Prompts dataset. Post-softmax scaling, a marked diverg

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.