[論文レビュー] Data Contamination Through the Lens of Time
本論文は、GPT-4およびGPT-3.5-Turboの既知のトレーニング終了日を活用することで、大規模言語モデル(LLM)におけるデータ汚染の最初の縦断的分析を提示する。CodeforcesおよびProject Euler——縦断的コーディングベンチマーク——を用いて、GitHubの人気度とモデルの通過率との間に、トレーニング終了日以前の問題に対してのみ統計的に有意な相関が存在することを示し、データ汚染の強力な実証的証拠を提供する。著者らは、今後のベンチマーク評価における厳密で再現可能な汚染分析を可能にするために、データセットと評価フレームワークをオープンソース化している。
Recent claims about the impressive abilities of large language models (LLMs) are often supported by evaluating publicly available benchmarks. Since LLMs train on wide swaths of the internet, this practice raises concerns of data contamination, i.e., evaluating on examples that are explicitly or implicitly included in the training data. Data contamination remains notoriously challenging to measure and mitigate, even with partial attempts like controlled experimentation of training data, canary strings, or embedding similarities. In this work, we conduct the first thorough longitudinal analysis of data contamination in LLMs by using the natural experiment of training cutoffs in GPT models to look at benchmarks released over time. Specifically, we consider two code/mathematical problem-solving datasets, Codeforces and Project Euler, and find statistically significant trends among LLM pass rate vs. GitHub popularity and release date that provide strong evidence of contamination. By open-sourcing our dataset, raw results, and evaluation framework, our work paves the way for rigorous analyses of data contamination in modern models. We conclude with a discussion of best practices and future steps for publicly releasing benchmarks in the age of LLMs that train on webscale data.
研究の動機と目的
- 大規模言語モデル(LLM)の縦断的コーディングベンチマーク(例:CodeforcesやProject Euler)におけるデータ汚染が性能に与える影響を調査すること。
- GPT-4およびGPT-3.5-Turboの既知のトレーニング終了日を自然な実験的分割として活用し、汚染の程度を測定すること。
- 時系列に整列された問題のリリース日を踏まえたモデルのパフォーマンストレンドの統計的分析を通じて、汚染の実証的証拠を提供すること。
- ウェブ規模のLLMトレーニングデータがパブリックベンチマークに与えるリスクを特定することで、パブリックベンチマークのリリースにおけるベストプラクティスを促進すること。
- データセット、評価コード、結果をオープンソース化することで、再現可能な汚染分析を可能にすること。
提案手法
- GPT-4およびGPT-3.5-Turboの既知のトレーニング終了日を活用し、ベンチマーク問題をトレーニング終了日以前(おそらく学習済み)と以降(おそらく未学習)のグループに分類する。
- Codeforces(2010–2023年)およびProject Euler(2001–2023年)から、問題のリリース日とGitHubでの存在を追跡する縦断的データセットを構築する。
- 回帰モデルを用いて、問題の特徴(例:GitHubの人気度、難易度)とLLMパフォーマンス指標(通過率、タイトル/タグの再現性)との関係を分析する。
- テストケース通過率と、タイトルおよびタグの意味的再現性を測定することで、記憶化や汚染効果を検出する。
- トレーニング終了日前後におけるパフォーマンストレンドの有意差を統計的推論により検出する。
- データセットのライセンス制約を考慮した上で、評価フレームワーク全体、元の結果、データセット構築パイプラインをオープンソース化する。
実験結果
リサーチクエスチョン
- RQ1トレーニング終了日以前にリリースされた問題と以降にリリースされた問題に対して評価した場合、LLMのパフォーマンスに統計的に有意な差が生じるか?
- RQ2問題がGitHubに存在するかどうかが、トレーニング終了日以前の問題に対してのみLLMの通過率を高める相関関係を示すか?これは汚染を示唆する。
- RQ3LLMは、トレーニング終了日以前にリリースされた問題のタイトルやタグを、終了日以降の問題よりも正確に再現する程度はどの程度か?
- RQ4問題の難易度とリリース日がモデルパフォーマンスに与える影響は何か?また、GPT-4とGPT-3.5-Turboのモデルごとにその影響は異なるか?
- RQ5ウェブ規模のLLMトレーニングの時代において、汚染がパブリックベンチマークの妥当性に与える影響は何か?
主な発見
- GPT-4では、トレーニング終了日以前のCodeforces問題に対してのみ、GitHubの人気度と通過率の間に統計的に有意な正の相関(p = 0.010)が認められ、汚染の兆候が示された。
- GPT-4の分析において、トレーニング終了日以前の期間におけるGitHub人気度の回帰係数は1.010(95%信頼区間:[0.994, 1.026])であり、わずかではあるが有意な汚染効果を示している。
- GPT-3.5-Turboでは、トレーニング終了日前後いずれの期間に対しても、GitHub人気度と通過率との間に有意な相関は認められなかった(それぞれp = 0.506およびp = 0.216)。
- Project Eulerデータセットにおいて、GPT-4はトレーニング終了日以前の期間に、難易度とタイトル再現性の間に有意な負の相関(p = 0.00001)を示しており、記憶化または汚染効果の可能性を示唆している。
- 両モデルとも、トレーニング終了日以降の期間において、GitHub人気度がタイトル再現性に与える影響は有意でなかったため、汚染は存在しないか、検出不能であると示唆されている。
- GPT-3.5-TurboのProject Eulerにおける分析では、トレーニング終了日以前の期間に対しても、GitHub人気度の回帰係数が0.981(p = 0.696)であり、汚染の証拠は見つからなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。