[論文レビュー] Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation
この論文は、学習データにアクセスできない状況下でも、データ汚染を推定するためのパープレキシティベースの手法を提案する。テストセットのパープレキシティを、同じソース分布からの記憶済みベースラインとクリーンベースラインと比較することで、特に大規模モデルにおいて、読解や要約のベンチマークに顕著な記憶が見られることが判明した。一方、MMLUのような複数選択式データセットでは、最小限の汚染が確認された。
Data contamination in model evaluation is getting increasingly prevalent as the massive training corpora of large language models often unintentionally include benchmark samples. Therefore, contamination analysis has became an inevitable part of reliable model evaluation. However, existing method of contamination analysis requires the access of the entire training data which is often confidential for recent models. This prevent the community to rigorously audit these models and conduct accurate assessment of their capability. In this paper, we propose a novel method to quantify contamination without the access of the full training set, that measure the extent of contamination with perplexity. Our analysis provides evidence of significant memorisation of recent foundation models in popular reading comprehension, summarisation benchmarks, while multiple choice appears less contaminated.
研究の動機と目的
- 訓練データが入手不可であるため、閉鎖型およびファインチューニング済み言語モデルに対する信頼できる汚染分析が不足している問題に対処すること。
- 完全な学習コーパスへのアクセスを必要とせずに、評価ベンチマークにおける記憶の度合いを定量化する手法を開発すること。
- n-gramオーバーラップ分析の代替手段として、スケーラブルかつアクセス可能な手法を提供することで、コミュニティ全体によるモデル能力の監査を可能にすること。
- モデルの尤度に基づく代理指標を用いて、主なNLPベンチマークにおけるデータ汚染の程度を評価すること。
提案手法
- 本手法は、テストセットのパープレキシティを、学習データから得たベースライン(記憶済みベースライン)と、学習データに含まれないデータから得たベースライン(クリーンベースライン)と比較する。
- ベースラインは、テストセットと同じソース分布からのものである——例として、読解タスクではWikipedia、要約タスクではBBCニュース——これにより、フォーマットや長さの比較が保証される。
- 各ベンチマークについて、モデルがテストセットに対して示すパープレキシティを測定し、記憶済みベースラインおよびクリーンベースラインの平均パープレキシティと比較する。
- テストセットのパープレキシティが記憶済みベースラインに近い場合、顕著な記憶と汚染が示唆される。
- 特に複数選択問題において一貫した入力フォーマットを実現するため、言語化技術を用いてパープレキシティ計算のための入力を統一する。
- 直接的にモデル尤度をパープレキシティで測定することで、高コストなn-gramオーバーラップ計算を回避する。
実験結果
リサーチクエスチョン
- RQ1訓練データにアクセスできない状況下で、大規模言語モデルにおける一般的な読解ベンチマークの汚染度合いはどの程度か?
- RQ2テストセットとベースライン間のパープレキシティの差が、記憶や汚染を信頼性を持って示せるか?
- RQ3読解、要約、複数選択問題といった異なる種類のベンチマークにおいて、汚染度合いはどのように異なるか?
- RQ4訓練データへのアクセスが制限される状況下で、小規模モデルは大規模モデルよりも記憶の影響を受けにくいのか?
主な発見
- gpt-3、llama-7b、13b、30bを含む全テスト対象のファウンデーションモデルが、QuAC、BoolQ、SQuAD_v2といった読解ベンチマークで顕著な記憶を示しており、パープレキシティ値が記憶済みベースラインに近づいている。
- LLaMA-30Bモデルは特に強い記憶を示しており、自らの記憶済みベースラインよりもSQuADで低いパープレキシティを達成している。
- XSumのような要約ベンチマークに対しても、すべてのモデルで汚染の兆候が強く、パープレキシティ値が記憶済みベースラインに近づいている。
- 一方、MMLUのような複数選択式ベンチマークでは明確な汚染トレンドが確認されず、データ作成時期との相関も見られなかったため、最小限の記憶が推定された。
- LLaMA-7Bのような小規模モデルは大規模モデルに比べて記憶が少ないが、それでも読解タスクにおいて測定可能な汚染を示している。
- 本手法は、訓練データへのアクセスがなくても、ベンチマークにおける汚染を的確に同定でき、閉鎖型およびファインチューニング済みモデルの信頼性ある評価を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。