[論文レビュー] Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models
この論文では、言語モデル(LM)のトレーニングを、相互に依存するスキルの系列としてモデル化するデータ駆動型フレームワーク、Skill-itを提案する。スキルグラフを用いて、効率的なデータサンプリングを導く。継続的プレトレーニングおよびファインチューニングにおけるスキル順序の活用により、LEGOではランダムサンプリングに比べて36.5ポイント高い精度を達成し、Natural Instructionsでは検証損失を13.6%削減し、静的およびベースラインのサンプリング手法を上回る性能を発揮した。
The quality of training data impacts the performance of pre-trained large language models (LMs). Given a fixed budget of tokens, we study how to best select data that leads to good downstream model performance across tasks. We develop a new framework based on a simple hypothesis: just as humans acquire interdependent skills in a deliberate order, language models also follow a natural order when learning a set of skills from their training data. If such an order exists, it can be utilized for improved understanding of LMs and for data-efficient training. Using this intuition, our framework formalizes the notion of a skill and of an ordered set of skills in terms of the associated data. First, using both synthetic and real data, we demonstrate that these ordered skill sets exist, and that their existence enables more advanced skills to be learned with less data when we train on their prerequisite skills. Second, using our proposed framework, we introduce an online data sampling algorithm, Skill-It, over mixtures of skills for both continual pre-training and fine-tuning regimes, where the objective is to efficiently learn multiple skills in the former and an individual skill in the latter. On the LEGO synthetic in the continual pre-training setting, Skill-It obtains 36.5 points higher accuracy than random sampling. On the Natural Instructions dataset in the fine-tuning setting, Skill-It reduces the validation loss on the target skill by 13.6% versus training on data associated with the target skill itself. We apply our skills framework on the recent RedPajama dataset to continually pre-train a 3B-parameter LM, achieving higher accuracy on the LM Evaluation Harness with 1B tokens than the baseline approach of sampling uniformly over data sources with 3B tokens.
研究の動機と目的
- データから導出される相互に依存するスキルとして言語モデルの能力を形式的にモデル化するフレームワークの構築。
- トレーニングデータに自然なスキルの学習順序が存在するか、およびそれがデータ効率的なトレーニングに活用可能であるかの調査。
- スキル依存関係を活用して、継続的プレトレーニングおよびファインチューニングにおける学習を加速する、動的かつオンラインのデータサンプリングアルゴリズムの設計。
- スキルベースの順序付けが、ランダムまたは静的サンプリング戦略と比較してモデル性能を向上させるかの検証。
- 合成データおよび実世界のデータセット(RedPajamaやNatural Instructionsを含む)におけるフレームワークの有効性の実証。
提案手法
- スキルをデータスライスから学習可能な行動の単位として定義し、有向グラフを用いて、前提条件の依存関係を示すエッジを含む順序付きスキル集合を形式化する。
- データクラスタリングと埋め込み分析を用いてスキル関係を同定し、合成データおよび実データセットで検証されたスキルグラフを構築する。
- スキル検証損失とグラフ構造に基づいて、動的にサンプリング重みを調整するオンラインデータ選択アルゴリズムであるSkill-itを設計する。
- 学習率スケジュールを用いた乗法的重み更新により、前提条件の依存関係を尊重しながら、より難しいスキルを優先する。
- スキルグラフを継続的プレトレーニングおよびファインチューニングの両方の枠組みに統合し、データミックス選択をガイドする。
- 複数のベンチマークで、Skill-itをランダムサンプリング、グラフなし、静的サンプリング(T=1)と比較するアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1実世界および合成の言語モデルトレーニングデータに、相互に依存するスキルセットが存在するか。また、データベースのクラスタリングと埋め込みを用いて形式的に定義可能か。
- RQ2前提スキルを事前に学習することで、より複雑なスキルを学習するのに必要なデータ量を削減でき、その結果として測定可能な性能向上が得られるか。
- RQ3Skill-itの動的かつグラフに依存するサンプリング戦略は、ランダムおよび静的サンプリングと比較して、収束速度および最終性能の面でどのように差がでるか。
- RQ4スキルグラフ構造とサンプリング重みのオンライン適応が、継続的プレトレーニングおよびファインチューニングにおける学習効率をどの程度向上させるか。
- RQ5フレームワークはRedPajamaやNatural Instructionsといった実世界のデータセットに一般化可能か。また、同じトークン予算内で均一サンプリングに比べて優れた性能を発揮するか。
主な発見
- 合成データを用いたLEGO継続的プレトレーニングタスクにおいて、Skill-itはランダムサンプリングに比べて36.5ポイント高い精度を達成し、スキル順序付けによる顕著な性能向上を示した。
- Natural Instructionsデータセットでは、ターゲットスキルに関連するデータのみでトレーニングした場合と比較して、Skill-itは検証損失を13.6%削減した。
- LEGO、Addition、Natural Instructionsを含むすべての評価対象データセットで、Skill-itは静的サンプリング(T=1)およびグラフなしベースラインを上回った。これは、動的適応とグラフに依存する重み付けによるものである。
- Natural Instructionsにおけるドメイン外評価では、12のスキルのうち7つで最も低い検証損失を達成し、平均損失は2.540と、静的手法の2.541~2.551を下回った。
- アブレーションスタディにより、スキルグラフとオンラインダイナミクスの両方が不可欠であることが確認された。両方を除去すると、特に難しいスキルへのトレーニングトークンの割り当てが最適でなくなる。
- フレームワークは、10億トークンでRedPajamaを継続的プレトレーニングした3Bパラメータの言語モデルが、LM Evaluation Harnessでより高い精度を達成できるようにした。これは、3Bトークンで均一サンプリングした場合よりも優れた性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。