Skip to main content
QUICK REVIEW

[論文レビュー] Our Evaluation Metric Needs an Update to Encourage Generalization

Swaroop Mishra, Anjana Arunkumar|arXiv (Cornell University)|Jul 14, 2020
Adversarial Robustness in Machine Learning参考文献 44被引用数 4
ひとこと要約

本稿では、訓練データとの意味的テクスト類似度(STS)に基づきテストサンプルに重みを付ける、WOODスコアと呼ばれる新しい評価指標を提案する。この指標は、分布外(OOD)に近いサンプルに対して高い重みを付けることで、モデルがより困難でOODに近いサンプルに一般化するよう促進する。これにより、ベンチマークの精度が低下し、性能の誇張が抑制され、誤ったパターンの利用を避ける、より頑健なモデルの開発が促進される。

ABSTRACT

Models that surpass human performance on several popular benchmarks display significant degradation in performance on exposure to Out of Distribution (OOD) data. Recent research has shown that models overfit to spurious biases and `hack' datasets, in lieu of learning generalizable features like humans. In order to stop the inflation in model performance -- and thus overestimation in AI systems' capabilities -- we propose a simple and novel evaluation metric, WOOD Score, that encourages generalization during evaluation.

研究の動機と目的

  • 標準ベンチマーク上でのAIモデルの能力の過大評価を是正すること。
  • 訓練データとの意味的テクスト類似度(STS)を用いて、テストサンプルの分布外(OOD)特性の度合いを特定・定量化すること。
  • より困難でOODに近いサンプルに高い重みを付けることで、モデルの一般化を促進する評価指標の開発。
  • 多様で意味的に類似度の低いデータに対する評価の焦点を移すことで、ベンチマーク精度の誇張を低減すること。
  • 外部のOODデータセットを必要とせず、OODの深刻度をスケーラブルかつデータ駆動的に制御できる手法の提供。

提案手法

  • 事前学習済み文書埋め込みを用いて、各テストサンプルとすべての訓練サンプル間のペアワイズSTSを計算する。
  • 上位b%の類似した訓練サンプルとの平均STSに基づき、テストサンプルをOOD深刻度の観点からソートする。
  • サンプルのOOD度(p)を、最も類似した訓練サンプルとの平均STSの逆数として定義し、ハイパーパrameter aおよびbを用いる。
  • WOODスコアを重み付き評価指標として提案する:$ W_{opt} = abla_{X_{ ext{Test}}} E_i p_i $、ここで $ p_i $ はOOD深刻度に応じて増加する。
  • WOOD精度($ W_{acc} $)を重み付き和として定義:$ A_1 + 2A_2 + 3A_3 $、ここで $ A_1, A_2, A_3 $ はそれぞれ低・中・高OOD度のサンプルにおける正答率を表す。
  • テストセットをSTSに基づき7段階の階層的ボックスに分割し、分布シフトの度合いが異なる状況でのモデル性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1STSは、NLPベンチマークにおいて、分布内(IID)と分布外(OOD)のサンプルを効果的に区別できるか?
  • RQ2STSに基づくOOD深刻度が増加するにつれて、モデルの性能がどの程度低下するか、そしてその低下度合いを定量化できるか?
  • RQ3OODサンプルの重要度を高める重み付き評価指標が、ベンチマーク精度の誇張を低減し、一般化を促進できるか?
  • RQ4WOODスコアは、さまざまなモデル(例:BERT、RoBERTa、CNN、LSTM)およびデータセット(例:SST-2、IMDb)において、異なるOOD深刻度レベルでどの程度の性能を示すか?
  • RQ5提案された指標は、データ拡張や対照セット作成を支援し、モデルの頑健性を向上させることができるか?

主な発見

  • テストサンプルと訓練データ間のSTSは、OODとIIDのサンプルを効果的に区別でき、STSが低いほどOOD深刻度が高くなる。
  • WOODスコアは、SST-2(IID)およびIMDb(OOD)の両方で10のモデルに対してベンチマーク精度を顕著に低下させ、より困難なサンプルに高い重みが付けられるため、性能の低下が顕著に現れた。
  • 訓練データとのSTSが低いサンプルでは、誤った予測に対して高いソフトマックス確率を示すことが判明し、OODサンプルは誤分類されやすいことが示された。
  • STSが低下するにつれて誤分類の数が増加し、類似度が低いほど予測の難易度が高くなることが確認された。
  • b(考慮する上位訓練サンプル数)の値が変化しても、アブレーションスタディで一貫した性能トレンドが観察されたため、指標は頑健である。
  • WOODスコアにより、同じデータセットをIIDおよびOODの両方の評価セットとして使用可能となる。これはSTSに基づく階層的分割により、外部OODデータセットの必要性がなくなることを意味する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。