Skip to main content
QUICK REVIEW

[論文レビュー] ConDA: Contrastive Domain Adaptation for AI-generated Text Detection

Amrita Bhattacharjee, Tharindu Kumarage|arXiv (Cornell University)|Sep 7, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

ConDAは、1つのLLMからのラベル付きソースデータと、別のLLMからのラベルなしターゲットデータを活用して、ターゲット生成器のラベルを必要とせずにAI生成ニューステキストを検出する対照的ドメイン適応フレームワークを提案する。ドメイン適応と対照的学習を組み合わせることで、完全に教師ありの検出器との差を0.8%以内にまで縮小し、ベースライン性能を平均31.7%向上させる最先端の性能を達成する。

ABSTRACT

Large language models (LLMs) are increasingly being used for generating text in a variety of use cases, including journalistic news articles. Given the potential malicious nature in which these LLMs can be used to generate disinformation at scale, it is important to build effective detectors for such AI-generated text. Given the surge in development of new LLMs, acquiring labeled training data for supervised detectors is a bottleneck. However, there might be plenty of unlabeled text data available, without information on which generator it came from. In this work we tackle this data problem, in detecting AI-generated news text, and frame the problem as an unsupervised domain adaptation task. Here the domains are the different text generators, i.e. LLMs, and we assume we have access to only the labeled source data and unlabeled target data. We develop a Contrastive Domain Adaptation framework, called ConDA, that blends standard domain adaptation techniques with the representation power of contrastive learning to learn domain invariant representations that are effective for the final unsupervised detection task. Our experiments demonstrate the effectiveness of our framework, resulting in average performance gains of 31.7% from the best performing baselines, and within 0.8% margin of a fully supervised detector. All our code and data is available at https://github.com/AmritaBh/ConDA-gen-text-detection.

研究の動機と目的

  • 新しいもしくは未確認のLLMのラベル付きデータが入手できない状況において、AI生成ニューステキストを検出する課題に対処すること。
  • ラベルなしターゲットドメインデータを活用することで、リソースが限られた環境における検出性能を向上させること。
  • 各新しい生成器に対して再トレーニングを必要とせずに、多様なLLMに一般化可能なフレームワークを構築すること。
  • 大規模なラベル付きデータセットへの依存を減らすために、検出問題を教師なしドメイン適応問題として定式化すること。
  • 対照的学習によりドメイン不変表現を促進することで、モデルのロバストネスと一般化性能を向上させること。

提案手法

  • 特徴抽出のためのバックボーンとして、ソースドメインおよびターゲットドメインの両方で事前学習済み言語モデル(RoBERTa)を用いる。
  • 同じサンプルの増強ビュー(正例)が類似した表現を持つようにし、ドメイン間の異なる例(負例)を分離するよう、対照的学習目的関数を適用する。
  • ドメイン識別器を用いて、ソースとターゲットドメインの特徴を統合し、ドメインシフトを最小限に抑えつつ、人間生成とAI生成テキストのタスク固有の差を保持する。
  • 共有エンコーダー重みを用いたマルチタスク学習目的関数により、検出精度とドメイン不変性の両方を同時に最適化する。
  • ラベル付きソースデータ(例:GROVER_mega)とラベルなしターゲットデータ(例:ChatGPT)を用いて、ターゲットラベルが不要な状態でエンドツーエンドで訓練する。
  • 対照的損失が正則化として機能し、ソース生成器への過学習を軽減するとともに、未確認のLLMへのゼロショット一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きソースLLMデータとラベルなしターゲットLLMデータしか入手できない状況で、対照的ドメイン適応フレームワークがAI生成ニューステキストを効果的に検出できるか。
  • RQ2対照的学習の統合が、AI生成テキスト検出におけるドメイン不変表現学習をどのように改善するか。
  • RQ3微調整をターゲットLLMのデータに対して行わず、ConDAが新規にリリースされたもしくは未確認のLLMにどの程度一般化できるか。
  • RQ4ゼロショット検出設定において、ConDAの性能は完全に教師あり検出器および既存の教師なしベースラインと比べてどの程度か。
  • RQ5対照的学習が、多様なLLMおよびテキストスタイルにわたるモデルのロバストネスと一般化性能にどのような影響を与えるか。

主な発見

  • ConDAは、教師なしAI生成テキスト検出において、最も性能の高かったベースラインモデル比で平均31.7%の性能向上を達成する。
  • 複数のベンチマークデータセットにおいて、完全に教師あり検出器との性能差を0.8%以内にまで縮小する。
  • ConDAは強力なゼロショット一般化を示し、他の生成器からのデータで学習した後でも、ChatGPTなどの未確認LLMからのテキストを効果的に検出できる。
  • 埋め込みの可視化結果から、ConDAはドメイン固有の特徴を効果的に低減するとともに、人間生成とAI生成テキストの分離性を保持していることが示された。
  • 対照的学習部が顕著にドメイン不変性を向上させ、潜在空間におけるドメインシフトが減少していることが裏付けられた。
  • GROVER_mega、GPT-3.5、ChatGPTを含む多様なLLMにおいて、高い性能を維持しており、強力な一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。