[論文レビュー] Data Selection for Fine-tuning Large Language Models Using Transferred Shapley Values
本稿では、ターゲット言語モデルの表現から学習された軽量な分類器と、サンプリングに基づく集約を用いて転送Shapley値を活用することで、大規模言語モデルの微調整における計算効率の高いデータ選択手法TS-DShapleyを提案する。本手法は最先端の性能を達成し、全データで微調整した場合と比較して、RoBERTaおよびDistilBERTの精度を最大3.4%向上させ、訓練データの2%のみを用いても効果を発揮する。
Although Shapley values have been shown to be highly effective for identifying harmful training instances, dataset size and model complexity constraints limit the ability to apply Shapley-based data valuation to fine-tuning large pre-trained language models. To address this, we propose TS-DShapley, an algorithm that reduces computational cost of Shapley-based data valuation through: 1) an efficient sampling-based method that aggregates Shapley values computed from subsets for valuation of the entire training set, and 2) a value transfer method that leverages value information extracted from a simple classifier trained using representations from the target language model. Our experiments applying TS-DShapley to select data for fine-tuning BERT-based language models on benchmark natural language understanding (NLU) datasets show that TS-DShapley outperforms existing data selection methods. Further, TS-DShapley can filter fine-tuning data to increase language model performance compared to training with the full fine-tuning dataset.
研究の動機と目的
- 大規模言語モデルの微調整における正確なShapley値計算の高い計算コストを軽減すること。
- 単純なスレーブモデルからの価値推定を転送することにより、データ評価のための高価なモデル再訓練の必要性を低減すること。
- 小さなデータサブセットからのShapley値の集約を用いて、微調整のためのスケーラブルなデータ選択を実現すること。
- Shapleyに基づく評価により特定された有害な訓練インスタンスをフィルタリングすることで、モデル性能を向上させること。
提案手法
- 訓練データの小さなランダムサブセット上でShapley値を計算し、それらを統合して全データセットのShapley値を推定するサンプリングベースの手法を提案する。
- ターゲット言語モデルの表現から学習された線形分類器を用いた価値転送メカニズムを導入し、本モデルの再訓練なしにデータ価値を推定する。
- スレーブモデルからのShapley値推定を用いて、低価値で、有害な可能性のある訓練インスタンスを同定・削除する。
- 特にサブセットサイズが小さい場合の推定の安定性と正確性を向上させるために、複数のサンプリングチェーンを活用する。
- スレーブモデルから導出された最適なデータ削除インデックスを、ターゲットモデルの微調整プロセスに適用する。
- RoBERTaやDistilBERTなどの事前学習済み埋め込みを、スレーブ分類器の入力特徴として用いることで、転送性と性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1効率的なサンプリングと価値転送を用いることで、大規模言語モデルの微調整におけるShapleyに基づくデータ評価をスケーラブルにできるか?
- RQ2ターゲットモデルの表現に線形分類器を適用することで、他の埋め込みと比較してデータ評価の正確性が向上するか?
- RQ3転送Shapley値を用いたデータ選択は、全データでの微調整と比較して、どれほど下流の性能向上に寄与するか?
- RQ4サブセットサイズとチェーン数といったサンプリングのハイパーパrameterは、データ選択プロセスの性能にどのように影響するか?
主な発見
- TS-DShapleyは、既存のデータ選択ベースラインおよび全微調整データセットを上回る性能を発揮した。
- 訓練データの2%のみを用いてShapley値推定を実施した結果、QQPデータセットにおいてDistilBERTの性能が全微調整よりも最大3.4%向上した。
- 同じデータセットで、RoBERTaはTS-DShapleyを用いることで全微調整と比較して1.3%の向上を達成した。
- サブセットサイズが訓練データの2%を超えた場合、サンプリングチェーン数と性能の間に強い正の相関(r = 0.94)が観察された。
- スレーブ分類器にターゲット言語モデルの表現を用いることで、GloVeや他の事前学習埋め込みと比較して、データ選択性能が一貫して優れていた。
- 本手法は有害なインスタンスを効果的に同定・削除でき、微調整後のモデルの汎化性能とロバスト性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。