Skip to main content
QUICK REVIEW

[論文レビュー] Towards Interpreting and Mitigating Shortcut Learning Behavior of NLU Models

Mengnan Du, Varun Manjunatha|arXiv (Cornell University)|Mar 11, 2021
Topic Modeling参考文献 53被引用数 11
ひとこと要約

本稿では、訓練データの特徴を長尾分布としてモデル化し、知識蒸留に基づく正則化子を用いて、短絡的特徴度が高めのサンプルにおける過信予測を抑制することで、NLUモデルの短絡的学習を緩和する新しいフレームワークLTGRを提案する。実験結果から、LTGRは3つのNLUベンチマークで分布外一般化性能を向上させつつ、分布内精度を損なわないことが示された。

ABSTRACT

Recent studies indicate that NLU models are prone to rely on shortcut features for prediction, without achieving true language understanding. As a result, these models fail to generalize to real-world out-of-distribution data. In this work, we show that the words in the NLU training set can be modeled as a long-tailed distribution. There are two findings: 1) NLU models have strong preference for features located at the head of the long-tailed distribution, and 2) Shortcut features are picked up during very early few iterations of the model training. These two observations are further employed to formulate a measurement which can quantify the shortcut degree of each training sample. Based on this shortcut measurement, we propose a shortcut mitigation framework LTGR, to suppress the model from making overconfident predictions for samples with large shortcut degree. Experimental results on three NLU benchmarks demonstrate that our long-tailed distribution explanation accurately reflects the shortcut learning behavior of NLU models. Experimental analysis further indicates that LTGR can improve the generalization accuracy on OOD data, while preserving the accuracy on in-distribution data.

研究の動機と目的

  • NLUモデルが意味的理解ではなく短絡的特徴に依存する理由を説明すること。
  • 短絡的特徴が訓練の初期段階で学習され、長尾特徴分布の先頭に集中していることを特定すること。
  • 長尾統計に基づいて、各訓練サンプルの短絡的特徴度を定量化する指標を構築すること。
  • 知識蒸留に基づく正則化子を用いて、高短絡的特徴度のサンプルに対するモデルの過信を低減するフレームワークLTGRを提案すること。
  • 分布外データに対するモデルの頑健性を向上させつつ、分布内性能を維持すること。

提案手法

  • 局所相互情報量を用いて訓練データセットの特徴を学習し、語彙的特徴の長尾分布を構築する。
  • NLUモデルが長尾分布の先頭にある特徴(一般化不能な短絡的特徴に相当)を好むことを特定する。
  • モデルの注目度とデータセットレベルの特徴統計を比較することで、各訓練サンプルの短絡的特徴度指標を定義する。
  • 高短絡的特徴度のサンプルに対する過信予測をペナルティ化する、知識蒸留に基づく正則化子であるLTGRを提案する。
  • 均一分布やクラスバランスをとった柔らかいラベル分布(例:均一またはクラスバランス)を、高短絡的特徴度のサンプルに対する教師信号として用い、過信を抑える。
  • ハイパーパrameter α で制御される、交差エントロピー損失と蒸留損失を組み合わせた重み付き損失を用いて、標準的な学習に正則化子を統合する。

実験結果

リサーチクエスチョン

  • RQ1NLU訓練データにおける語彙的特徴の長尾分布が、短絡的学習行動を説明できるか?
  • RQ2NLUモデルが主にどの段階で短絡的特徴を学習するか?
  • RQ3データセット統計とモデル行動から、短絡的特徴度の定量的指標を導出できるか?
  • RQ4高短絡的特徴度のサンプルに対する過信の抑制が、分布外データにおける一般化性能の向上に寄与するか?
  • RQ5提案手法が短絡的特徴に基づくトロイの木馬攻撃を緩和できるか?

主な発見

  • NLU訓練データにおける語彙的特徴の長尾分布が、モデルが意味的理解ではなく短絡的特徴を好む理由を正確に説明している。
  • NLUモデルは訓練の最初の数イテレーション内で短絡的特徴を学習しており、高頻度で一般化不能なパターンへの強いバイアスが初期に形成されていることが示された。
  • 提案された短絡的特徴度指標は、各訓練サンプルがどれほど不適切な語彙的手がかりに依存しているかを効果的に定量化している。
  • LTGRは、例としてMNLIのハードバリデーションセットなど、分布外ベンチマークにおける一般化性能を最大で5.2%向上させつつ、分布内性能を損なわない。
  • ハイパーパrameter分析から、中程度の正則化(α ≈ 0.5)が分布外一般化性能と分布内精度の両立を最適に達成しており、過剰なペナルティを回避していることが分かった。
  • 予備の実験から、LTGRはバックドアトリガーのパターンへのモデル依存度を低下させることで、短絡的特徴に基づくトロイの木馬攻撃を部分的に緩和できる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。