[論文レビュー] Rethinking Benchmark and Contamination for Language Models with Rephrased Samples
本稿では、標準的なn-gramおよび埋め込みベースの不純物除去手法を回避する、意味的に同等だが言語的に異なるバリエーションをもつ再表現されたサンプル(再表現サンプル)を導入する。本稿では、このような変化を検出できるLLMベースの不純物除去手法を提案し、RedPajama-1T や StarCoder-Data といった実世界のデータセットにおいて、事前に未知の不純物が存在することを明らかにした。HumanEval と 8–18% の重複を示し、信頼性の高いLLM評価を保証するため、一回限りの新規ベンチマークの構築を要請する。
Large language models are increasingly trained on all the data ever produced by humans. Many have raised concerns about the trustworthiness of public benchmarks due to potential contamination in pre-training or fine-tuning datasets. While most data decontamination efforts apply string matching (e.g., n-gram overlap) to remove benchmark data, we show that these methods are insufficient, and simple variations of test data (e.g., paraphrasing, translation) can easily bypass these decontamination measures. Furthermore, we demonstrate that if such variation of test data is not eliminated, a 13B model can easily overfit a test benchmark and achieve drastically high performance, on par with GPT-4. We validate such observations in widely used benchmarks such as MMLU, GSK8k, and HumanEval. To address this growing risk, we propose a stronger LLM-based decontamination method and apply it to widely used pre-training and fine-tuning datasets, revealing significant previously unknown test overlap. For example, in pre-training sets such as RedPajama-Data-1T and StarCoder-Data, we identified that 8-18\% of the HumanEval benchmark overlaps. Interestingly, we also find such contamination in synthetic dataset generated by GPT-3.5/4, suggesting a potential risk of unintentional contamination. We urge the community to adopt stronger decontamination approaches when using public benchmarks. Moreover, we call for the community to actively develop fresh one-time exams to evaluate models accurately. Our decontamination tool is publicly available at https://github.com/lm-sys/llm-decontaminator.
研究の動機と目的
- n-gram重複や埋め込み類似度といった現在の不純物除去手法が、意味的に同等だが言語的に異なるテストデータを検出できないことの限界を明らかにすること。
- ベンチマークサンプルの単純な再表現により、13Bモデルが過学習し、検出を回避しながらGPT-4レベルのパフォーマンスを達成できることを示すこと。
- GPT-3.5/4が生成したデータを含む、広く使われている事前学習および合成データセットにおける、これまで検出されなかった不純物を明らかにすること。
- 正確で信頼性のあるLLM評価を保証するため、一回限りの新規ベンチマークの構築を提唱すること。
提案手法
- 元のベンチマーク質問を再表現(要約や翻訳)することで、意味は保ちつつ文字列ベースの検出を回避する再表現サンプルをLLMを用いて生成する。
- 各テストサンプルの上位-k候補マッチを特定するために、埋め込み類似度検索を適用する。
- GPT-4などの強力なLLMを用いて、上位-kの候補のうちどれかがテストサンプルと意味的にあまりに近いかを判断し、微細な不純物を検出可能にする。
- 実世界のデータセット(RedPajama-1T、StarCoder-Data、CodeAlpacaなど)にLLMベースの不純物除去器を適用し、隠れたテスト類似度の重複を特定する。
- 再表現されたベンチマークで微調整されたモデルのパフォーマンスを評価し、標準的な検出手法を回避する過学習の可能性を示す。
- 動的で一回限りの試験(例:CodeForces)を長期的な解決策として採用することを提言する。
実験結果
リサーチクエスチョン
- RQ1意味的に同等だが、言い換えや翻訳といった単純な言語的変化により、標準的なn-gramおよび埋め込みベースの不純物除去手法がLLMベンチマークで検出不能になることはあるか?
- RQ2再表現されたテストサンプルで微調整された13Bモデルが、検出を回避しながらGPT-4と同等のパフォーマンスを達成できる程度の過学習が可能か?
- RQ3GPT-3.5/4が生成したデータを含む、広く使われている事前学習および合成データセットにおけるベンチマーク不純物の真の範囲はどの程度か?
- RQ4従来の手法と比較して、LLMベースの不純物除去手法は、文字列が一致しないが意味的に類似した不純物をどの程度効果的に検出できるか?
- RQ5一回限りの新規ベンチマークは、不純物リスクを軽減し、LLM評価の信頼性を向上させることができるか?
主な発見
- 要約や翻訳によって生成された再表現サンプルは、標準的なn-gram重複や埋め込み類似度手法では検出不能となり、不純物アラームが発動しないままモデルの過学習を可能にする。
- 13BのLlama-2モデルが再表現されたMMLU、GSM-8k、HumanEvalのサンプルで微調整された場合、GPT-4と同等のパフォーマンスを示し、顕著な過学習の可能性を示している。
- LLMベースの不純物除去手法は、埋め込み検索とLLMによる意味的類似度判断を組み合わせることで、従来のアプローチを著しく上回る性能を発揮している。
- RedPajama-Data-1T や StarCoder-Data といった事前学習データセットでは、HumanEvalのテストケースの8–18%が再表現バージョンによって不純物として特定された。
- GPT-3.5が生成した合成データセット(例:CodeAlpaca)には、HumanEvalの12.8%が再表現されたサンプルを含んでおり、合成データ学習における意図しない不純物のリスクを示している。
- 本研究では、オープンソースおよびプロプライエタリなデータセットにおいて、これまで未知の不純物が存在することを明らかにし、コミュニティがより強力な不純物除去手法を採用し、動的で一回限りの評価ベンチマークに移行するよう促している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。