[論文レビュー] Are Interpretations Fairly Evaluated? A Definition Driven Pipeline for Post-Hoc Interpretability
本稿は、自然言語処理における事後解釈のための定義駆動型パイプライン(DDP)を提案する。解釈を敵対的摂動を用いて定義することで、解釈アルゴリズムと評価指標の整合性を保証する。評価指標に内在するバイアスが忠実度の評価を歪める可能性があることを示し、DDPが既存の手法を統合するとともに、敵対的訓練によって人間の根拠とより良い整合性を達成できることを示す。
Recent years have witnessed an increasing number of interpretation methods being developed for improving transparency of NLP models. Meanwhile, researchers also try to answer the question that whether the obtained interpretation is faithful in explaining mechanisms behind model prediction? Specifically, (Jain and Wallace, 2019) proposes that "attention is not explanation" by comparing attention interpretation with gradient alternatives. However, it raises a new question that can we safely pick one interpretation method as the ground-truth? If not, on what basis can we compare different interpretation methods? In this work, we propose that it is crucial to have a concrete definition of interpretation before we could evaluate faithfulness of an interpretation. The definition will affect both the algorithm to obtain interpretation and, more importantly, the metric used in evaluation. Through both theoretical and experimental analysis, we find that although interpretation methods perform differently under a certain evaluation metric, such a difference may not result from interpretation quality or faithfulness, but rather the inherent bias of the evaluation metric.
研究の動機と目的
- 事後解釈手法のための一貫性のある評価基準の欠如を是正すること。
- 忠実度の評価を歪める既存の評価指標に内在するバイアスを特定・軽減すること。
- 敵対的攻撃に基づく一貫した定義の下で、多様な解釈手法を統合すること。
- 敵対的訓練を用いて、モデルの解釈を人間が指定した根拠と整合性を持たせること。
- 忠実で定義に基づいた解釈手法の開発と評価のための体系的フレームワークを提供すること。
提案手法
- 敵対的攻撃をコア定義として用い、予測を変更するために必要な最小摂動として解釈を定義する。
- 特定の制約下で、既存の解釈手法(例:勾配ベース、アテンションベース)をDDPフレームワークの特別なケースとして導出する。
- 定義と内在的に整合する忠実度の指標を定式化し、公平な評価を保証する。
- 人間がアノテートした根拠を用いて、解釈が人間の認知と一致するように再訓練する戦略を導入し、CSA指標を監視信号として使用する。
- 複数のモデル(LSTM、BERT、LSTM_att)とデータセット(SST-2、Yelp、AGNews)にDDPフレームワークを適用し、一貫性と公平性を検証する。
- 固定されたエプシロンを用いた敵対的訓練により摂動を生成し、重要度スコアを ||x^n - x^{*n}||_2 として計算する。
実験結果
リサーチクエスチョン
- RQ1統一された解釈の定義によって、異なる手法間での忠実度評価の不整合を解消できるか?
- RQ2評価指標が、解釈手法の性能評価を歪める程度はどの程度か?
- RQ3モデルの説明における解釈を、人間が指定した根拠と体系的に整合させることは可能か?
- RQ4アテンションや勾配といった一般的に使われる解釈手法は、本当に忠実なのか、それとも指標設計のバイアスによって評価が歪められているのか?
- RQ5敵対的摂動は、NLPにおける事後解釈のための原理的で汎用的な定義として機能できるか?
主な発見
- 解釈手法の忠実度は、評価指標の選択に極めて敏感であり、手法の質の差ではなく、指標バイアスによって顕著な性能差が生じることが判明した。
- 多くの既存の解釈手法、例えばIntegrated Gradient や SmoothGrad は、特定の制約下ではDDPフレームワークと数学的に同等であることが示され、これらが一貫した定義の下で統合されることを示した。
- 人間がアノテートした根拠を用いた敵対的訓練により、モデルの解釈と人間の認知との整合性が向上し、SST-2では再訓練後、類似度が0.48から0.72に上昇した。
- Yelpデータセットでは、DDPベースの評価により、VaGradとSmoothGradがCSA指標において他の手法を上回ったが、ERAやMMA指標では順位が変化し、指標依存性が顕著に現れた。
- JainとWallace(2019)が提唱した忠実度の2つの性質は、普遍的ではない。これらは解釈の定義に依存するが、DDPはその定義を明確に形式化している。
- 敵対的再訓練の結果、モデルの精度はわずかに低下した(例:SST-2では0.81から0.791に)。これは、敵対的訓練におけるロバストネスと精度のトレードオフが確認されたことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。