[論文レビュー] Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding
本稿では、自然言語処理(NLP)モデル圧縮における知識蒸留とpruning(剪定)が、インダミイン(in-distribution)性能は優れているものの、分布外(OOD)の堅牢性を低下させることを特定している。本稿では、サンプルの不確実性を用いて訓練を平滑化する正則化フレームワークRMCを提案する。この手法により、容易な/ショートカットなサンプルへの過学習を減らすことで、複数のNLUタスクにおいてインダミイン性能を損なわずにOOD一般化性能が向上する。
Recent work has focused on compressing pre-trained language models (PLMs) like BERT where the major focus has been to improve the in-distribution performance for downstream tasks. However, very few of these studies have analyzed the impact of compression on the generalizability and robustness of compressed models for out-of-distribution (OOD) data. Towards this end, we study two popular model compression techniques including knowledge distillation and pruning and show that the compressed models are significantly less robust than their PLM counterparts on OOD test sets although they obtain similar performance on in-distribution development sets for a task. Further analysis indicates that the compressed models overfit on the shortcut samples and generalize poorly on the hard ones. We further leverage this observation to develop a regularization strategy for robust model compression based on sample uncertainty. Experimental results on several natural language understanding tasks demonstrate that our bias mitigation framework improves the OOD generalization of the compressed models, while not sacrificing the in-distribution task performance.
研究の動機と目的
- 知識蒸留および剪定による圧縮モデルが、完全な事前学習言語モデル(PLM)と比較して、分布外(OOD)データにおいても堅牢性を保っているかどうかを調査すること。
- 圧縮モデルがOODデータで一般化がうまくいかない理由を分析すること、特に容易またはショートカットなサンプルへの過学習の傾向に焦点を当てる。
- インダミイン性能を維持しつつ、モデル圧縮中にOOD一般化性能を向上させる汎用的な正則化フレームワークを開発すること。
- 圧縮レベルの影響をバイアスおよび堅牢性の観点から定量的に評価すること、特にサンプルの難易度との関係を明らかにすること。
提案手法
- 教師モデルの剪定バージョンから得られる複数のサブネットワークにおける予測分散を用いて、サンプルの難易度を推定する。
- この不確実性測度を、サンプル固有の重み係数として用い、知識蒸留および微調整プロセスを平滑化する。
- 推定されたサンプルの不確実性に基づいて損失重みを調整することで、蒸留および剪定の過程でインスタンス単位の平滑化を実施する。
- 不確実性に基づく正則化を、知識蒸留および反復的マグニチュード剪定のパイプラインに統合する。
- 不確実性を考慮した損失関数を用いて圧縮モデルを訓練し、容易/ショートカットなサンプルへの過学習を低減するとともに、難易度の高いサンプルの学習を向上させる。
- 標準的なインダミインおよびOODテストセット(HANSおよびテキスト帰属推論ベンチマークを含む)を用い、複数のNLUタスクでフレームワークを評価する。
実験結果
リサーチクエスチョン
- RQ1知識蒸留および剪定されたモデルは、分布外(OOD)テストセットにおいて、PLMと同等の堅牢性を示すのか?
- RQ2圧縮レベルを変化させることで、圧縮モデルのOOD一般化性能およびバイアスにどのような影響が生じるのか?
- RQ3サンプルの不確実性を活用することで、難易度の異なるサンプル全体にわたるモデル圧縮の正則化および一般化性能の向上が可能になるか?
- RQ4不確実性に基づく平滑化は、容易/ショートカットなサンプルへの過学習を低減させるとともに、難易度の高いサンプルでの性能向上を実現するのか?
主な発見
- MNLIタスクにおいて、RMCは、vanilla微調整に比べてHANSベンチマークでのOOD一般化精度を最大6.9ポイント向上させ、スパarsityレベルにかかわらず一貫した向上を示した。
- 反復的マグニチュード剪定では、RMCはvanillaチューニングに比べて相対バイアス指標$\mathcal{F}_{\text{bias}}$を10%低減し、知識蒸留では10.4%低減した。
- MNLIタスクにおいて、40%スパarsity条件下で、知識蒸留の下では難易度の高いサンプルと低いサンプルの性能差を11.3%、剪定の下では10.6%低減した。
- QQPタスクでは、RMCはインダミイン開発セットおよびOODテストセットの両方で性能を向上させ、標準的な性能にトレードオフがないことを示した。
- 圧縮モデルは、常に完全なPLMに比べてOODデータで性能が劣り、ショートカット/容易なサンプルへの過学習と、難易度の高いサンプルでの一般化の悪さが顕著に観察された。
- 提案された不確実性に基づく正則化は、容易なサンプルへの過学習を効果的に緩和し、難易度の高いサンプルの学習を向上させ、全体の堅牢性を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。