[論文レビュー] BERT on a Data Diet: Finding Important Examples by Gradient-Based Pruning
この論文は、コンピュータビジョンで開発された勾配ベースのデータプリーニング指標GraNdとEL2Nを、自然言語処理(NLP)に適応し、少なくとも1エポックの微調整後に重要度が高いとされる例(これらの指標で選別)を用いてBERTを微調整することで、全データセットを用いた場合と同等またはそれ以上の性能を維持できることを示している。主な発見は、スコアが最も高い(おそらくノイジーな)例をプリーニングすることで一般化性能が向上し、特にMNLIでは全データの66%を用いた場合に全セットを用いた場合よりも高い精度を達成していることである。
Current pre-trained language models rely on large datasets for achieving state-of-the-art performance. However, past research has shown that not all examples in a dataset are equally important during training. In fact, it is sometimes possible to prune a considerable fraction of the training set while maintaining the test performance. Established on standard vision benchmarks, two gradient-based scoring metrics for finding important examples are GraNd and its estimated version, EL2N. In this work, we employ these two metrics for the first time in NLP. We demonstrate that these metrics need to be computed after at least one epoch of fine-tuning and they are not reliable in early steps. Furthermore, we show that by pruning a small portion of the examples with the highest GraNd/EL2N scores, we can not only preserve the test accuracy, but also surpass it. This paper details adjustments and implementation choices which enable GraNd and EL2N to be applied to NLP.
研究の動機と目的
- コンピュータビジョンで使用されていた勾配ベースのデータ重要度指標GraNdおよびEL2Nを、自然言語処理(NLP)分野に適応し、重要な学習例を同定すること。
- これらの指標が、BERTのような事前学習言語モデル(PLM)において高価値の学習例を同定できるかどうかを調査すること。
- 特にGraNd/EL2Nスコアが高くなる例(低重要度)をプリーニングすることで、モデルの性能が向上または維持されるかどうかを評価すること。
- PLMの特徴的なダイナミクスを考慮し、微調整中にこれらのスコアを計算する最適なタイミングを特定すること。
- 高スコアの例(おそらくノイジーな例)を削除することで、全データセットを用いた学習よりも良好な一般化性能が得られるかどうかを評価すること。
提案手法
- GraNdスコアを、複数回のランダムな重み初期化を用いて、損失勾配の期待L2ノルムとして推定する。
- EL2Nを用いてGraNdを近似し、予測誤差(予測値 - one-hotラベル)の期待L2ノルムを、複数回の学習実行において計算する。
- 異なるランダムシードを用いた5回の独立した学習実行を通じて、各学習例の安定的かつ平均化されたEL2NおよびGraNdスコアを計算する。
- 1回の完全な微調整エポック後に、EL2NまたはGraNdスコアで順位付けされた上位k%の学習例を選別し、BERT-baseをその上でのみ微調整する。
- 精度を指標として用い、AG News(トピック分類)およびMNLI(自然言語推論)タスクにおける性能を評価する。
- 構造的プリーニングによる利点を評価するため、ランダムプリーニングベースラインおよび全データセット微調整と比較する。
実験結果
リサーチクエスチョン
- RQ1元々ビジョン向けに設計されたGraNdおよびEL2Nを、NLPおよび事前学習言語モデル(例:BERT)に効果的に適応できるか?
- RQ2PLMの文脈において、GraNd/EL2Nスコアを信頼できるものにするために、少なくとも1回の完全な微調整エポックを経ることが必要か?
- RQ3GraNd/EL2Nスコアで測定したスコアが最も高い例をプリーニングすることで、全データセットを用いた学習よりも良いテスト性能が得られるか?
- RQ4EL2N/GraNdベースの選択を用いた場合、保持するデータの割合が性能にどのように影響するか?
- RQ5わずかな割合の高スコア例(おそらくノイジーな例)を削除することで、NLPタスクにおけるモデルの一般化性能が向上するか?
主な発見
- NLPにおいては、GraNdおよびEL2Nスコアが信頼できるものになるまでに、少なくとも1回の完全な微調整エポックが必要である。これは、ビジョン分野とは異なり、初期段階のスコアは有用でないことを示している。
- MNLIデータセットにおいて、上位4%の高スコア例を除外した66%のデータで微調整した場合、全データセットを用いた微調整よりも高い精度を達成している。
- AG Newsでは、高スコア例をプリーニングすることで、全データセットを用いた場合と同等の性能を達成しながら、データ量を67%にまで削減でき、データ効率の向上が示された。
- 1つのランダムシードからのEL2NおよびGraNdスコアと、5つのシードからの平均スコアとの間には高い相関(Spearman r = 0.9311)が確認され、各シードで1エポック分の学習で十分な信頼性が得られることを示している。
- EL2N/GraNdで選別された上位k%の例を用いたモデルの性能は、保持するデータ割合が増加するにつれて単調に向上し、少なくとも70%のデータを保持する場合にランダムプリーニングを上回る。
- 一部のケース、特にMNLIでは、高スコア例を削除することで、それらを含めた学習よりも良好な一般化性能が得られることが示され、高スコア例がノイジーまたは学習が難しいインスタンスである可能性があると示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。