[論文レビュー] Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
本稿では、大規模な事前学習データセットのプルーニングに、小規模言語モデル(125Mパラメータ)を用いてパープレキシティスコアを計算することを提案し、より大きなモデル(3Bパラメータ)の下流性能を顕著に向上させている。パープレキシティに基づくプルーニングにより、事前学習ステップ数が最大1.45倍まで短縮され、さまざまなデータセット構成において平均下流精度が最大2.04ポイント向上することを示している。
In this work, we investigate whether small language models can determine high-quality subsets of large-scale text datasets that improve the performance of larger language models. While existing work has shown that pruning based on the perplexity of a larger model can yield high-quality data, we investigate whether smaller models can be used for perplexity-based pruning and how pruning is affected by the domain composition of the data being pruned. We demonstrate that for multiple dataset compositions, perplexity-based pruning of pretraining data can \emph{significantly} improve downstream task performance: pruning based on perplexities computed with a 125 million parameter model improves the average performance on downstream tasks of a 3 billion parameter model by up to 2.04 and achieves up to a $1.45 imes$ reduction in pretraining steps to reach commensurate baseline performance. Furthermore, we demonstrate that such perplexity-based data pruning also yields downstream performance gains in the over-trained and data-constrained regimes.
研究の動機と目的
- 小規模言語モデルが、大規模言語モデルの事前学習に適した高品質なデータサブセットを効果的に特定できるかどうかを評価すること。
- データセットのドメイン構成が、パープレキシティベースのデータプルーニングの有効性に与える影響を調査すること。
- 過学習やデータ制約下の訓練環境といった非標準的な訓練レジームにおいて、パープレキシティベースのプルーニングが及ぼす影響を評価すること。
- データプルーニング介入において、上流のテストセットパープレキシティが下流性能向上の信頼できる代理指標であるかどうかを特定すること。
- Pile や Dolma のような、ドメイン分布が異なる多様なデータセットにおいて、パープレキシティベースのプルーニングの有効性を比較すること。
提案手法
- 事前学習データセットのランダムサブセット上で、小規模な参照言語モデル(125Mパラメータ)を訓練する。
- 小規模な参照モデルを用いて、全データセットの各サンプルのパープレキシティスコアを計算する。
- 特定のパープレキシティ範囲内(最低または最高のスコア)のサンプルを選択することで、データセットをプルーニングする。
- プルーニングされたデータセット上で、より大きなターゲットモデル(3Bパラメータ)を微調整し、下流性能を評価する。
- MMLU や HellaSwag、BIG-bench などの複数の下流ベンチマークを用いて、上流指標を超えたモデル性能を評価する。
- Pile のような多様でキュレートされたドメインを含むデータセットと、Dolma のようなウェブスクラップデータを含むデータセットにおいて、プルーニングの結果を比較する。
実験結果
リサーチクエスチョン
- RQ1小規模な参照モデルは、はるかに大きなターゲット言語モデルの性能を向上させる高品質なデータサブセットを効果的に特定できるか?
- RQ2事前学習データセットのドメイン構成が、パープレキシティベースのデータプルーニングの有効性にどのように影響するか?
- RQ3過学習やデータ制約下の訓練レジームにおいて、パープレキシティベースのデータプルーニングが性能向上をもたらすか?
- RQ4上流のテストセットパープレキシティは、データプルーニングによる下流性能向上を信頼できる指標として使えるか?
- RQ5ドメイン分布が異なるデータセットにおいて、低パープレキシティと高パープレキシティのサンプルを選択するといった、異なるプルーニング戦略の有効性にどのような差が生じるか?
主な発見
- 125Mパラメータの参照モデルを用いたパープレキシティベースのプルーニングにより、3Bパラメータのモデルの平均下流性能がベンチマーク評価で最大2.04ポイント向上した。
- 同じプルーニング戦略により、ベースライン性能に到達するための事前学習ステップ数が最大1.45倍まで短縮され、顕著な訓練効率の向上が示された。
- プルーニングの有効性はデータセットによって顕著に異なり、Pile(多様でキュレートされたドメイン)では最も効果的であったが、Dolma(ウェブスクラップで偏ったデータ)ではやや劣った。これはドメイン構成に強い感受性を示している。
- パープレキシティベースのプルーニングは、過学習やデータ制約下の訓練レジームにおいても測定可能な向上をもたらし、標準的な事前学習設定を超えた堅牢性を示した。
- 上流のテストセットパープレキシティは、データプルーニングの有効性を評価するための誤解を招く指標であることが判明した。一部の介入では下流性能が向上したが、上流指標に影響を与えていなかった。
- 本研究は、ターゲットモデルがパラメータ数で30倍も大きい場合でさえ、小規模な参照モデルがデータ品質フィルタリングの有効なプロキシとして機能できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。