Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Data Contamination for Pre-training Language Models

Minhao Jiang, Ken Ziyu Liu|arXiv (Cornell University)|Jan 11, 2024
Topic Modeling被引用数 4
ひとこと要約

この論文は、意図的に汚染されたコーパスを用いてGPT-2モデルを再訓練することで、事前学習言語モデルにおけるデータ汚染を調査し、入力テキストと正解の両方の汚染が下流タスクのパフォーマンスを顕著に向上させることを明らかにした。現在のLLMレポートで用いられるn-gramベースの汚染定義が不十分であることを示し、繰り返しの汚染がパフォーマンス向上を強化する結果となり、汚染に対するモデルの頑健性に関する主張に疑問を呈する。

ABSTRACT

Language models pre-trained on web-scale corpora demonstrate impressive capabilities on diverse downstream tasks. However, there is increasing concern whether such capabilities might arise from evaluation datasets being included in the pre-training corpus -- a phenomenon known as extit{data contamination} -- in a manner that artificially increases performance. There has been little understanding of how this potential contamination might influence LMs' performance on downstream tasks. In this paper, we explore the impact of data contamination at the pre-training stage by pre-training a series of GPT-2 models extit{from scratch}. We highlight the effect of both text contamination ( extit{i.e.}\ input text of the evaluation samples) and ground-truth contamination ( extit{i.e.}\ the prompts asked on the input and the desired outputs) from evaluation data. We also investigate the effects of repeating contamination for various downstream tasks. Additionally, we examine the prevailing n-gram-based definitions of contamination within current LLM reports, pinpointing their limitations and inadequacy. Our findings offer new insights into data contamination's effects on language model capabilities and underscore the need for independent, comprehensive contamination assessments in LLM studies.

研究の動機と目的

  • 事前学習段階でのデータ汚染の影響を、評価時における後向きの分析ではなく、事前学習段階そのもので調査すること。
  • 入力テキストと正解(プロンプトと答え)の両方の汚染が、下流タスクにおけるモデルパフォーマンスに与える影響を検討すること。
  • 異なるモデルサイズにおける繰り返し汚染の影響が、モデルパフォーマンスに与える効果を評価すること。
  • 最近のLLMレポートで用いられるn-gramベースの汚染定義の妥当性を批判的に評価すること。
  • 評価段階での汚染分析に基づくLLMの頑健性主張に反論すること。これは、真の事前学習段階での汚染効果が隠れてしまう可能性がある。

提案手法

  • 評価データセットの入力と正解ペアを意図的に汚染したコーパスを用いて、GPT-2-smallおよびGPT-2-largeモデルを再訓練する。
  • 汚染の形を系統立てて変化させ、コーパスに注入する:入力のみ、入力+プロンプト、入力+答え、および完全な入力+プロンプト+答え汚染。
  • 同じ評価サンプルを複数回繰り返し注入することで、繰り返し汚染が下流パフォーマンスに与える影響を調査する。
  • 最近のLLMレポートで用いられるn-gramベースの汚染定義を適用し、トレーニングデータをフィルタリングした上で再訓練を行い、その有効性を評価する。
  • 標準的なNLPベンチマークでモデルを評価し、汚染状況やフィルタリング済みコーパスごとのパフォーマンスを比較する。
  • ゼロショットおよびフェイシング評価プロトコルを組み合わせて用い、多様な下流タスクにおけるモデルの挙動を評価する。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 入力テキストと正解の両方の汚染が、事前学習段階における言語モデルのパフォーマンスにどのように影響を与えるか?
  • RQ2RQ2: 事前学習コーパスに同じサンプルが繰り返し汚染された場合、下流モデルパフォーマンスにどのような影響があるか?
  • RQ3RQ3: 最近のLLMレポートで用いられるn-gramベースの汚染定義は、事前学習コーパスにおける真の汚染をどれだけ効果的に検出できるか?
  • RQ4RQ4: 現在の評価段階での汚染分析は、汚染に対するモデルの頑健性をどれだけ正確に反映しているか?

主な発見

  • 正解の汚染(プロンプトと答えを含む)は、入力テキストの汚染のみよりも顕著に高い下流パフォーマンスをもたらし、モデルの挙動が記憶された指導信号に強く影響されることを示している。
  • 同じ評価サンプルが事前学習コーパスに繰り返し注入されると、下流パフォーマンスは単調に上昇し、複数回の注入後も性能向上が持続する。
  • 最近のLLMレポートで用いられるn-gramベースの汚染定義は、評価データが言い換えられたり構造的に変更されたりした場合、多くの真の汚染事例を検出できないため、頑健性主張の妥当性を損なう。
  • n-gramベースの定義でフィルタリングしたコーパスで訓練されたモデルですら、汚染されたベンチマークで高いパフォーマンスを示すため、このようなフィルタリングは汚染を確実に除去できないことが示され、モデルの頑健性が過大評価されている可能性がある。
  • 評価段階での汚染分析(汚染済みおよび非汚染済みのチャンクを別々にテスト)は、事前学習段階での汚染効果を正確に反映していない。モデルのインダクティブバイアスが性能差を隠してしまうためである。
  • 本研究は、現在の汚染検出および頑健性評価手法が不十分であることを明らかにし、意味的認識を組み込んだより正確な定義と検出メカニズムの開発が急務であることを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。