[論文レビュー] Deduplicating Training Data Makes Language Models Better
本稿では、正確な部分文字列照合とn-gramハッシュを用いた近似的なドキュメント照合により、言語モデル学習データセットのスケーラブルな重複除去フレームワークを提案する。C4などのデータセットから類似または完全に同一のテキストを除去することで、微調整されたモデルの記憶率が10倍低減され、学習効率が向上し、学習・テストデータの重複がなくなることでモデル評価の正確性が向上することを示している。
We find that existing language modeling datasets contain many near-duplicate examples and long repetitive substrings. As a result, over 1% of the unprompted output of language models trained on these datasets is copied verbatim from the training data. We develop two tools that allow us to deduplicate training datasets -- for example removing from C4 a single 61 word English sentence that is repeated over 60,000 times. Deduplication allows us to train models that emit memorized text ten times less frequently and require fewer train steps to achieve the same or better accuracy. We can also reduce train-test overlap, which affects over 4% of the validation set of standard datasets, thus allowing for more accurate evaluation. We release code for reproducing our work and performing dataset deduplication at https://github.com/google-research/deduplicate-text-datasets.
研究の動機と目的
- C4、Wiki-40B、LM1B、RealNewsといった広く使われている言語モデル学習データセットに、重複および類似したコンテンツがどの程度広がっているかを調査すること。
- 学習・テストデータの重複とデータの重複が、言語モデルの性能指標を誇張し、記憶率を高めることの問題に対処すること。
- 大規模データセットから完全一致および類似した重複テキストを効率的に除去する、スケーラブルで計算的に効率の良い重複除去パイプラインの開発と評価を行うこと。
- 重複除去されたデータセットが、著しく記憶率が低く抑えられ、学習効率が向上し、より信頼性の高い評価が可能になるモデルをもたらすことを実証すること。
提案手法
- 同じ例とは異なる場所に出現するテキストセグメントの完全一致を検出・除去するため、正確な部分文字列照合を用いる。
- n-gramの重複に基づく局所性に敏感なハッシュ(LSH)を用いた近似的なドキュメント照合を適用し、類似度の高いドキュメントを特定する。
- C4のようなテラバイトスケールのデータセットに対しても、CPUオンリーで線形時間で処理可能なアルゴリズムを用いて、スケーラブルな重複除去を実現する。
- 複数のモデルアーキテクチャとデータセットを対象に、重複除去がモデルの記憶率、パープレキシティ、学習効率に与える影響を測定する。
- オリジナルデータセットと重複除去済みデータセットの両方でモデル出力を比較し、記憶されたテキストの頻度とテストセットとの重複度に注目して、結果を検証する。
- 重複除去フレームワークをオープンソースとして公開し、NLP研究分野における再現性と採用を促進する。
実験結果
リサーチクエスチョン
- RQ1標準的なNLP学習データセット(C4、Wiki-40B、LM1B、RealNews)において、類似または完全に同一の例はどの程度広がっているか?
- RQ2標準的なベンチマークデータセットにおける学習・テストデータの重複は、モデル評価にどのような影響を与え、過学習を引き起こすか?
- RQ3学習データの重複除去が、微調整された言語モデルにおける記憶されたテキスト生成率にどのような影響を与えるか?
- RQ4重複除去は、パープレキシティと収束速度という指標で測定した場合、学習効率とモデル性能を向上させるか?
- RQ5重複除去されたデータセットは、誤った記憶やデータ漏洩を低減することで、より信頼性の高い正確なモデル評価を可能にするか?
主な発見
- C4のような標準的なデータセットで学習されたモデルの、プロンプトなし出力の1%以上が、学習データからの完全一致の記憶テキストを含んでいた。
- 重複除去により、記憶されたテキスト生成率が10倍に低下し、重複除去済みデータで学習したモデルでは0.14–0.19%の頻度で記憶テキストが出力された一方、オリジナルデータで学習したモデルでは1.93–3.34%の頻度であった。
- C4に61,036回、バリデーションセットに61回も繰り返された61語の文が発見され、顕著な学習・テストデータの重複が確認された。
- 重複除去済みデータセットは最大19%小さくなり、学習時間とコスト、環境への影響が低減された一方で、パープレキシティは維持または向上した。
- 重複除去済みデータで学習したモデルは、同じまたはそれ以上の精度をより少ない学習ステップで達成したため、学習効率が向上したことが示された。
- 重複除去によるパープレキシティの低下はなく、一部のケースでは最大10%向上した。これは、質の高い学習データがより良い一般化をもたらすことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。