Skip to main content
QUICK REVIEW

[논문 리뷰] ConDA: Contrastive Domain Adaptation for AI-generated Text Detection

Amrita Bhattacharjee, Tharindu Kumarage|arXiv (Cornell University)|2023. 09. 07.
Topic ModelingComputer Science인용 수 3
한 줄 요약

ConDA는 한 개의 LLM으로부터의 레이블이 부여된 소스 데이터와 다른 LLM으로부터의 레이블이 없는 타겟 데이터를 활용하여, 타겟 생성기의 레이블이 필요 없이 AI 생성 뉴스 텍스트를 탐지하는 대비 도메인 적응 프레임워크를 제안한다. 도메인 적응과 대비 학습을 결합함으로써 ConDA는 최신 기술 성능을 달성하며, 완전히 감독되는 탐지기와의 격차를 0.8% 이내로 줄이고 기준 모델 대비 평균 31.7% 향상된 성능을 기록한다.

ABSTRACT

Large language models (LLMs) are increasingly being used for generating text in a variety of use cases, including journalistic news articles. Given the potential malicious nature in which these LLMs can be used to generate disinformation at scale, it is important to build effective detectors for such AI-generated text. Given the surge in development of new LLMs, acquiring labeled training data for supervised detectors is a bottleneck. However, there might be plenty of unlabeled text data available, without information on which generator it came from. In this work we tackle this data problem, in detecting AI-generated news text, and frame the problem as an unsupervised domain adaptation task. Here the domains are the different text generators, i.e. LLMs, and we assume we have access to only the labeled source data and unlabeled target data. We develop a Contrastive Domain Adaptation framework, called ConDA, that blends standard domain adaptation techniques with the representation power of contrastive learning to learn domain invariant representations that are effective for the final unsupervised detection task. Our experiments demonstrate the effectiveness of our framework, resulting in average performance gains of 31.7% from the best performing baselines, and within 0.8% margin of a fully supervised detector. All our code and data is available at https://github.com/AmritaBh/ConDA-gen-text-detection.

연구 동기 및 목표

  • 새로운 또는 알려지지 않은 LLM에 대한 레이블이 없는 데이터가 존재할 때 AI 생성 뉴스 텍스트를 탐지하는 데 도전하는 것.
  • 레이블이 없는 타겟 도메인 데이터를 활용하여 자원이 제한된 환경에서 탐지 성능을 향상시키는 것.
  • 각 새로운 생성기마다 재학습이 필요 없이 다양한 LLM에 일반화되는 프레임워크를 개발하는 것.
  • 감독되지 않은 도메인 적응 문제로 간주함으로써 대규모 레이블 데이터셋에 대한 의존도를 줄이는 것.
  • 대비 학습을 통해 도메인 불변 표현을 장려함으로써 모델의 강건성과 일반화 능력을 향상시키는 것.

제안 방법

  • 프레임워크는 소스 및 타겟 도메인 전반에서 특징 추출을 위해 사전 훈련된 언어 모델(RoBERTa)을 백본으로 사용한다.
  • 동일한 샘플의 증강된 시각(예: 같은 샘플의 다양한 변형)을 양의 쌍으로 삼고, 서로 다른 도메인 간의 음의 쌍을 분리시키는 대비 학습 목표를 적용한다.
  • 특징을 소스와 타겟 도메인 간에 정렬하기 위해 도메인 식별기가 사용되며, 도메인 간의 이동을 최소화하면서 인간과 AI 생성 텍스트 간의 작업 특화된 차이를 유지한다.
  • 공유된 인코더 가중치를 사용하는 다중 작업 학습 목표를 통해 탐지 정확도와 도메인 불변성을 동시에 최적화한다.
  • 레이블이 부여된 소스 데이터(GROVER_mega 등)와 레이블이 없는 타겟 데이터(ChatGPT 등)를 사용하여 엔드 투 엔드로 훈련되며, 타겟 레이블이 필요 없다.
  • 대비 손실은 정규화 역할을 하여 소스 생성기로의 과적합을 줄이고, 알려지지 않은 LLM으로의 제로샷 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1레이블이 부여된 소스 LLM 데이터와 레이블이 없는 타겟 LLM 데이터만 존재할 때, 대비 도메인 적응 프레임워크가 AI 생성 뉴스 텍스트를 효과적으로 탐지할 수 있는가?
  • RQ2대비 학습의 통합이 AI 생성 텍스트 탐지에 있어 도메인 불변 표현 학습을 어떻게 향상시키는가?
  • RQ3ConDA는 타겟 LLM의 데이터로의 피지컬 트레이닝 없이 새롭게 출시되거나 알려지지 않은 LLM으로 얼마나 잘 일반화되는가?
  • RQ4제로샷 탐지 환경에서 ConDA의 성능은 완전히 감독되는 탐지기와 기존의 무감독 기준 모델 대비 어떻게 비교되는가?
  • RQ5대비 학습이 다양한 LLM과 텍스트 스타일 간의 모델 강건성과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • ConDA는 무감독 AI 생성 텍스트 탐지에서 가장 성능이 뛰어난 기준 모델 대비 평균 31.7% 향상된 성능을 기록한다.
  • 여러 벤치마크 데이터셋에서 완전히 감독되는 탐지기와의 성능 격차를 0.8% 이내로 줄였다.
  • ConDA는 강력한 제로샷 일반화 능력을 보이며, 다른 생성기의 데이터로만 훈련된 후에도 ChatGPT와 같은 알려지지 않은 LLM의 텍스트를 효과적으로 탐지한다.
  • 임베딩의 시각화 결과, ConDA는 도메인 특화된 특징을 성공적으로 줄였지만 인간과 AI 생성 텍스트 간의 분리 가능성을 유지했다.
  • 대비 학습 구성 요소는 잠재 공간에서의 도메인 이동 감소를 통해 도메인 불변성 향상이 뚜렷하게 나타났다.
  • GROVER_mega, GPT-3.5, ChatGPT를 포함한 다양한 LLM에서 높은 성능을 유지하여 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.