Skip to main content
QUICK REVIEW

[論文レビュー] "Will You Find These Shortcuts?" A Protocol for Evaluating the Faithfulness of Input Salience Methods for Text Classification

Jasmijn Bastings, Sebastian Ebert|arXiv (Cornell University)|Nov 14, 2021
Topic Modeling被引用数 5
ひとこと要約

本稿では、特徴重要度の順序付けの真実を確立するための部分的合成データを用いた、テキスト分類における入力サリエンス手法の忠実性を評価するプロトコルを提案する。実験では、BERTおよびLSTMモデルにおける語彙的ショートカットの検出において、Grad-L2のような単純な手法が、統合勾配の複雑な設定を上回ることを示し、手法の信頼性に関する仮定に疑問を呈する。

ABSTRACT

Feature attribution a.k.a. input salience methods which assign an importance score to a feature are abundant but may produce surprisingly different results for the same model on the same input. While differences are expected if disparate definitions of importance are assumed, most methods claim to provide faithful attributions and point at the features most relevant for a model's prediction. Existing work on faithfulness evaluation is not conclusive and does not provide a clear answer as to how different methods are to be compared. Focusing on text classification and the model debugging scenario, our main contribution is a protocol for faithfulness evaluation that makes use of partially synthetic data to obtain ground truth for feature importance ranking. Following the protocol, we do an in-depth analysis of four standard salience method classes on a range of datasets and shortcuts for BERT and LSTM models and demonstrate that some of the most popular method configurations provide poor results even for simplest shortcuts. We recommend following the protocol for each new task and model combination to find the best method for identifying shortcuts.

研究の動機と目的

  • テキスト分類における入力サリエンス手法の忠実性を評価するための標準的かつ信頼性のある方法の欠如に対処すること。
  • 特に語彙的ショートカットの検出を目的とした、サリエンス手法の体系的評価を可能にするプロトコルの開発。
  • 一般的に用いられるサリエンス手法の設定が、BERTおよびLSTMモデルにおいてショートカットを同定する際に信頼できるかどうかを検証すること。
  • ベースライン選択や勾配低減の詳細な手法設定(例:L1 vs. ドット積)が、ショートカット検出性能に与える影響を実証的に明らかにすること。
  • NLPモデルにおける誤った相関関係やヒューリスティックに基づく予測を特定するのに最も効果的なサリエンス手法の選定を、実務家にガイドすること。

提案手法

  • 特定の語彙的ショートカット(例:単一トークン、トークンペア、文脈的パターン)を組み込んだ部分的合成データセットを用い、特徴重要度の真の順序付けを明確に定義する。
  • 各入力に対して、サリエンス手法がトークンごとの重要度スコアを生成し、その順位付けを既知のショートカットトークンと照合して忠実度メトリクスを算出する。
  • プロトコルは、統合勾配、Grad-CAMの変種(例:Grad-L2)、LIME、勾配×入力の4つのサリエンス手法クラスを、複数のデータセットおよびモデルタイプ(BERTおよびLSTM)で評価する。
  • 主なメトリクスには、精度@1と平均逆順位(MRR)が含まれ、これらは、手法が特定した最重要トークンが真のショートカットに一致しているかを測定する。
  • モデルデバッグの文脈において、モデルが意味的コンテンツではなく単純な語彙的パターンに依存しているかどうかを検出することが目的である。
  • 異なるベースライン入力や勾配低減戦略(例:L1 vs. ドット積)といった、手法設定の間で制御された比較が可能である。

実験結果

リサーチクエスチョン

  • RQ1テキスト分類モデルにおける単純な語彙的ショートカットを同定する際、どの入力サリエンス手法の設定が最も効果的か?
  • RQ2ベースライン選択や勾配低減といった手法設定が、既知のショートカットを検出する際のサリエンスマップの忠実度にどのように影響するか?
  • RQ3モデルアーキテクチャ(例:BERT対LSTM)やショートカットの種別(単一トークン、文脈的、順序付きペア)に跨って、サリエンス手法の性能が一般化するか?
  • RQ4最近の文献で「忠実」と仮定されている手法(例:l-meanを用いた統合勾配)は、実世界のNLPモデルにおいてショートカットを検出する際に一貫して信頼できるか?
  • RQ5合成ショートカットに基づくプロトコルは、サリエンス手法の忠実度を評価する信頼性があり再現可能なベンチマークを提供できるか?

主な発見

  • Grad-L2という単純な勾配ベース手法が、BERTおよびLSTMモデルの両方において、統合勾配のより複雑な設定を常に上回り、語彙的ショートカットの検出に優れていた。
  • L1またはドット積による勾配低減を施した統合勾配は、単一トークンショートカットにおいて精度@1が12〜13%にまで低下し、忠実度が弱いことが示された。
  • ベースライン入力の選択がサリエンスの結果に顕著に影響を与え、一部の設定では単純なショートカットに対しても誤った帰属を生じさせることがあった。
  • 手法の性能はショートカットの種別によって一貫していなかった:例えば「3 out of 10」といった順序付きペアを学習したモデルは、単一トークンショートカットよりも解釈が難しく、モデルアーキテクチャによって性能が変動した。
  • プロトコルは、最近の文献で信頼されているとされる手法設定(例:l-meanを用いたIG)が、実際には著しく失敗することが明らかになった。特にBERTモデルでは顕著であった。
  • BERTモデルでは、最も単純な手法(Grad-L2)がショートカットを特定するのに最も効果的であり、より複雑な手法が本質的に忠実であるという仮定に疑問を呈した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。