Skip to main content
QUICK REVIEW

[論文レビュー] Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models

Shahriar Golchin, Mihai Surdeanu|arXiv (Cornell University)|Nov 10, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)におけるデータ汚染の検出と推定を、黙認的読解タスクとして定式化することで、モデル重みや事前学習データにアクセスせずに、汚染検出をブラックボックスで行う新規手法であるData Contamination Quiz(DCQ)を紹介する。DCQは、データセットのインスタンスに対して3つの語彙レベルの変種を生成し、「なし」の選択肢を追加することで、LLMsの記憶特性を活用し、トレーニングデータへの露出を特定する。この手法は、モデル重みや事前学習データにアクセスできない状況下でも、先行研究の最高水準手法に比べて汚染推定値を最大80倍まで向上させた。

ABSTRACT

We propose the Data Contamination Quiz (DCQ), a simple and effective approach to detect data contamination in large language models (LLMs) and estimate the amount of it. Specifically, we frame data contamination detection as a series of multiple-choice questions, devising a quiz format wherein three perturbed versions of each instance, subsampled from a specific dataset partition, are created. These changes only include word-level perturbations. The generated perturbations, along with the original dataset instance, form the options in the DCQ, with an extra option accommodating the selection of none of the provided options. Given that the only distinguishing signal among the options is the exact wording with respect to the original dataset instance, an LLM, when tasked with identifying the original dataset instance, gravitates towards selecting the original one if it has been exposed to it. While accounting for positional biases in LLMs, the quiz performance reveals the contamination level for the tested model with the dataset partition to which the quiz pertains. Applied to various datasets and LLMs, under controlled and uncontrolled contamination, our findings, while fully lacking access to training data and model parameters, suggest that DCQ achieves state-of-the-art results and uncovers greater contamination levels through memorization compared to existing methods. Also, it proficiently bypasses more safety filters, especially those set to avoid generating copyrighted content.

研究の動機と目的

  • モデル重みや事前学習データにアクセスできない状況下で、効果的かつスケーラブルなデータ汚染検出手法が不足している問題に対処すること。
  • 単に存在の有無を検出するのではなく、汚染レベルを定量的に測定する手法を開発すること。
  • 既存手法の限界、たとえば安全フィルタへの感受性や、LLMsに内在する位置バイアスによる過大評価を克服すること。
  • 実世界の展開において、LLMの耐性と公平性を評価するための実用的でリソースを低く抑えたソリューションを提供すること。

提案手法

  • 各データセットインスタンスに対して5択の複数選択クイズを設計:オリジナル1つ、文脈的に適切な同義語を用いて語彙レベルで変更されたバージョン3つ、および「なし」の選択肢。
  • GPT-4を用いたゼロショットプロンプティングにより、意味的類似性を保ちつつ語彙形を変更した変種を生成。
  • オリジナルインスタンスを正しく特定する能力を測定することで、記憶とデータ汚染の兆候を指標とする。
  • オリジナルインスタンスの選択肢内での位置を体系的に入れ替え、位置バイアスの影響を軽減し、最大性能を汚染推定値として報告。
  • 複数の配置順序における最高の正答率を用いて、LLMsの位置的好みを考慮した耐性のある汚染推定値を算出。
  • 先行研究の再現ベース手法との相互評価により、結果の整合性と高い検出感度を確認。

実験結果

リサーチクエスチョン

  • RQ1モデル重みや事前学習データにアクセスできない状況下で、複数選択式読解タスクがブラックボックスLLMsにおけるデータ汚染を効果的に検出できるか。
  • RQ2DCQ手法は、感度と推定精度の観点から、最先端の汚染検出技術と比較してどの程度優れているか。
  • RQ3DCQは、著作権保護や記憶済みコンテンツの生成を防ぐために設計された安全フィルタをどの程度回避できるか。
  • RQ4LLMsに内在する位置バイアスに対して、DCQはどの程度耐性を示し、実際にはどのように緩和されているか。
  • RQ5真の汚染レベルが不明な実世界の制御不能なデータセットにおいて、DCQは汚染を検出できるか。

主な発見

  • DCQは、Golchin & Surdeanu(2023)が提唱した最先端手法に比べ、事前学習データにアクセスできない状況下でも汚染レベルを最大80倍も高く検出できた。
  • 制御された環境下では、DCQの汚染推定値はOpenAIが公表した数値とよく一致したが、特にGSM8kのような高影響度ベンチマークでは著しく高い汚染レベルを示した。
  • WNLI や XSum といった実世界のデータセットでは、それぞれ最大50.70%および95.00%の汚染率を検出しており、多様な分野にわたり検出能力を示した。
  • 著作物保護や記憶済みコンテンツ生成を防ぐために設計された安全フィルタを効果的に回避できたことから、一般的な緩和戦略に対して耐性があることが示された。
  • 再現ベース手法との相互評価では完全な一致が得られ、DCQの信頼性と、記憶の検出における高い感度が確認された。
  • 抽出ベースおよび再現ベースのアプローチに比べ、DCQは特に低~中程度の汚染状況において優れた性能を示し、他の手法が検出できなかった状況でも検出に成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。