[論文レビュー] When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale
本論文は、大規模言語モデル(LLM)の事前学習におけるスケールにおけるデータプリーニングを調査し、単純なパープレキシティに基づくランク付けが、EL2N や記憶度といった複雑な指標を上回ることを提案している。驚くべきことに、元のデータセットの30%のみをパープレキシティで選別したモデルが、より洗練された手法でプリーニングされたモデルよりも最大2.1%の性能向上を達成した。これは、質を優先すれば、量よりも少ないデータでも優れた結果が得られることを示している。
Large volumes of text data have contributed significantly to the development of large language models (LLMs) in recent years. This data is typically acquired by scraping the internet, leading to pretraining datasets comprised of noisy web text. To date, efforts to prune these datasets down to a higher quality subset have relied on hand-crafted heuristics encoded as rule-based filters. In this work, we take a wider view and explore scalable estimates of data quality that can be used to systematically measure the quality of pretraining data. We perform a rigorous comparison at scale of the simple data quality estimator of perplexity, as well as more sophisticated and computationally intensive estimates of the Error L2-Norm and memorization. These metrics are used to rank and prune pretraining corpora, and we subsequently compare LLMs trained on these pruned datasets. Surprisingly, we find that the simple technique of perplexity outperforms our more computationally expensive scoring methods. We improve over our no-pruning baseline while training on as little as 30% of the original training dataset. Our work sets the foundation for unexplored strategies in automatically curating high quality corpora and suggests the majority of pretraining data can be removed while retaining performance.
研究の動機と目的
- データプリーニングがより高品質な学習例を選択することで、LLMの性能を向上させられるかどうかを評価すること。
- パープレキシティ、EL2N、記憶度といった単純な指標と複雑な指標の両方が、LLMの事前学習においてどれほど効果的であるかを比較すること。
- 大規模なウェブスクラップデータセットから低インパクトな例を除去することで、モデル性能が向上し、データ量が削減されるかどうかを調査すること。
- 人為的ラベルによる品質ラベルに依存せずに、高品質なコーパスキュレーションのためのスケーラブルで自動化されたフレームワークを確立すること。
- プリーニング戦略が、さまざまなモデルサイズ、データセット、および学習ステップにおいてモデルの一般化性能にどのように影響するかを理解すること。
提案手法
- 著者らは、事前学習データセット内の各シーケンスについて、参照用のLLMを用いてパープレキシティ、EL2N、記憶度スコアを計算する。
- これらのスコアに基づいてすべての学習シーケンスをランク付けし、上位、中央、下位のパcentile(10%、30%、50%、70%)のデータのみを保持する。
- 同じハイパーパrameterを用いて、ベースラインと同一の設定で、プリーニングされたデータセットから新規にLLMをファインチューニングする。
- この手法は、複数のモデルサイズ(124M〜1.5Bパラメータ)、複数の事前学習データセット、および変動する合計学習ステップに適用される。
- 性能はテストセットのパープレキシティと、下流のGLUEベンチマーク結果を用いて評価される。
- このフレームワークにより、異なるデータサブセットおよびモデル設定におけるプリーニング戦略の系統的比較が可能になる。

実験結果
リサーチクエスチョン
- RQ1自動品質推定器に基づくデータプリーニングは、全データセットで学習させる場合と比較して、LLMの性能を向上させられるか?
- RQ2計算コストの高い指標(EL2N や記憶度)よりも、単純なパープレキシティに基づくプリーニング手法が優れているか?
- RQ3データサブセットの選択(上位、中央、下位スコア)が、さまざまなモデルサイズおよび学習データ量においてモデル性能にどのように影響するか?
- RQ4プリーニングは、GLUEのようなベンチマークにおける下流の一般化能力を保持または向上させるか?
- RQ5品質推定に従って、顕著なデータ削減(例:70%のデータ削減)がなされても、モデル性能が維持または向上するか?
主な発見
- パープレキシティに基づくプリーニングは、すべてのモデルサイズおよびデータ量において、EL2N や記憶度に基づくプリーニングを上回った。
- パープレキシティプリーニングにより、元のデータセットの30%のみを用いて学習したモデルが、最良のEL2Nプリーニングモデルよりも2.1%、最良の記憶度プリーニングモデルよりも1.6%のテストパープレキシティの向上を達成した。
- 50%のデータでさえも、パープレキシティプリーニングモデルは、全データベースラインモデルよりも1.33%、EL2Nベースモデルよりも1.77%の性能向上を達成した。
- プリーニングによる性能向上は、124M〜1.5Bパラメータのさまざまなモデルサイズにおいて一貫しており、このアプローチのスケーラビリティが示された。
- 最低パープレキシティ(最も簡単な)例をプリーニングすると性能が低下したため、『最も簡単な』データが事前学習には最適でないことが示された。
- パープレキシティに基づくプリーニングにより、半分のデータ量でテストパープレキシティが1%向上した。これは、極めて高いデータ効率性を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。