Skip to main content
QUICK REVIEW

[論文レビュー] The Irrationality of Neural Rationale Models

Yiming Zheng, Serena Booth|arXiv (Cornell University)|Oct 14, 2021
Explainable Artificial Intelligence (XAI)被引用数 5
ひとこと要約

この論文は、神経的リーダーサポートモデルが本質的に解釈可能であるという仮定に疑問を呈し、意味を保った最小限の摂動に対しても、そのリーダーサポート選択プロセスが不安定であることを示している。自動分析とユーザースタディーを通じて、選択器およびユーザーユーザーの両方がリーダーサポートの変化を理解できないことを示しており、特にCRのような高精度モデルにおいて、リーダーサポートが信頼できる説明であるという主張を揺るがしている。

ABSTRACT

Neural rationale models are popular for interpretable predictions of NLP tasks. In these, a selector extracts segments of the input text, called rationales, and passes these segments to a classifier for prediction. Since the rationale is the only information accessible to the classifier, it is plausibly defined as the explanation. Is such a characterization unconditionally correct? In this paper, we argue to the contrary, with both philosophical perspectives and empirical evidence suggesting that rationale models are, perhaps, less rational and interpretable than expected. We call for more rigorous and comprehensive evaluations of these models to ensure desired properties of interpretability are indeed achieved. The code can be found at https://github.com/yimingz89/Neural-Rationale-Analysis.

研究の動機と目的

  • 神経的リーダーサポートモデルがボトルネック構造を有することから、本質的に解釈可能であるという広く受け入れられている信念に挑戦すること。
  • これらのモデルにおけるリーダーサポート選択プロセスが、意味を保った最小限の摂動に対して安定しており、理解可能かどうかを調査すること。
  • 機械学習の専門家を含むユーザーユーザーが、小さな入力変更の後でリーダーサポートの変化を信頼できて、予測できるかどうかを評価すること。
  • リーダーサポート選択プロセスに透明性のない信号が埋め込まれる可能性のある失敗モードを露呈すること。
  • 神経的リーダーサポートモデルにおける解釈可能性の主張に対して、より厳密で体系的な評価を提唱すること。

提案手法

  • Stanford Sentiment Treebank (SST) データセットに対して、非敵対的で意味を保った文の摂動を実施し、リーダーサポートの安定性をテストした。
  • 連続的リラクゼーション (CR) モデルとポリシー勾配 (PG) モデルの2つのモデルを用いて、摂動がリーダーサポート選択に与える影響を分析した。
  • 自動分析には、摂動と関連するリーダーサポートの変更頻度と位置、変更された語の品詞 (POS) 組成の追跡が含まれる。
  • ML修士課程の学生を対象にユーザースタディーを実施し、入力-出力の例を用いて、摂動前後のリーダーサポートパターンの一致能力を評価した。
  • 1文あたりの摂動がリーダーサポートの変更を引き起こす回数を数えることで、文ごとの安定性を測定した。
  • リーダーサポートが目に見えない手がかりを介して予測をエンコードできる反例を提示した。

実験結果

リサーチクエスチョン

  • RQ1意味を保った最小限の摂動が、神経的リーダーサポートモデルのリーダーサポート選択に顕著で予測不能な変化を引き起こすことはあるか?
  • RQ2小さな入力変更の後で、ユーザーユーザー(専門家を含む)がリーダーサポートの変化をどれほど理解したり予測したりできるか?
  • RQ3性能-解釈可能性のトレードオフは、リーダーサポートモデルに現れるのか?特に高精度モデルでは解釈性が低下するのか?
  • RQ4リーダーサポート選択プロセスに、モデルの説明可能性を損なう非透明な信号が隠れているのか?
  • RQ5ボトルネック構造だけが、リーダーサポートが忠実で解釈可能な説明であることを保証するのに十分か?

主な発見

  • CRモデルでは、品詞が『名詞』の語に対して37.1%のリーダーサポート変更が観察されたが、PGモデルでは同じカテゴリで42.7%の変更頻度を示し、モデル間での不安定さが明らかになった。
  • CRモデルでは、70%を超えるリーダーサポート変更が、摂動を加えた語以外の語の置き換えに起因しており、間接的かつ予測不能な影響が示された。
  • PGモデルの78.3%のリーダーサポート変更が摂動を加えた語の位置で発生したが、同じ位置での変更はCRモデルでも29.6%にのぼり、広範な影響が見られた。
  • ユーザースタディーでは、参加者が80組のリーダーサポートペアのうち45組しか正しく一致できず、MLの専門家であるにもかかわらず、ランダムな推測レベルの性能にとどまった。
  • リーダーサポートの変更は文全体に均等に分布しており、大部分の不安定性を占める少数の文は存在せず、問題は局所的ではなくシステム的であることが示された。
  • より高い精度を達成したCRモデルでは、すべての指標で安定性と解釈性が劣っており、性能-解釈性のトレードオフが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。