Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating neural network explanation methods using hybrid documents and morphological prediction.

Nina Pörner, Hinrich Schütze|arXiv (Cornell University)|Jan 19, 2018
Explainable Artificial Intelligence (XAI)参考文献 22被引用数 4
ひとこと要約

本稿では、手動のアノテーションを必要としないNLPモデルの説明を評価する2つの自動的パラダイムを提案する:1つはハイブリッドドキュメントを用いたもの、もう1つは語彙・構文的整合性を利用するものである。勾配ベースの手法がCNNに対して最も効果的であることが示され、メモリセル分解法がLSTMに対して優れている。また、LIMSSE—LIMEのサブストリングベースの拡張—を導入し、ハイブリッドドキュメント評価で最高のパフォーマンスを達成した。

ABSTRACT

We propose two novel paradigms for evaluating neural network explanations in NLP. The first paradigm works on hybrid documents, the second exploits morphosyntactic agreements. Neither paradigm requires manual annotations; instead, a relevance ground truth is generated automatically. In our experiments, successful explanations for Long Short Term Memory networks (LSTMs) were produced by a decomposition of memory cells (Murdoch & Szlam, 2017), while for convolutional neural networks, a gradient-based method by (Denil et al., 2014) works well. We also introduce LIMSSE, a substring-based extension of LIME (Ribeiro et al., 2016) that produces the most successful explanations in the hybrid document experiment.

研究の動機と目的

  • NLPにおけるニューラルネットワークの説明のための自動的でアノテーションフリーの評価フレームワークを開発すること。
  • NLPモデルの説明手法に対する信頼性がありスケーラブルな評価手法の不足を是正すること。
  • 勾配ベースの手法やメモリセル分解法といった異なる説明手法の、さまざまなアーキテクチャにおける有効性を比較すること。
  • LIMSSE—LIMEのサブストリングベースの拡張—を新たに導入し、新しいハイブリッドドキュメント評価設定で評価すること。
  • 言語的構造と語彙・構文的整合性を用いて自動生成された関連性の真値の信頼性を検証すること。

提案手法

  • 最初のパラダイムは、制御された言語的変異を含む人工的構築されたテキスト(ハイブリッドドキュメント)を用い、構造的一致性に基づいて自動的に関連性の真値を生成する。
  • 2番目のパラダイムは、文における語彙・構文的整合性(例:主語・動詞の一致)を活用し、どのトークンが予測結果に関連しているかを推定する。
  • 関連性の真値は言語ルールと構造的一致性から自動的に導出され、人手によるアノテーションの必要がなくなる。
  • LIMSSEは、トークンレベルの摂動ではなくサブストリングレベルで動作するLIMEの拡張であり、ハイブリッドドキュメント設定での局所化を向上させる。
  • 説明は、自動生成された関連性の真値との整合性を相関係数や類似度指標で測定することで評価される。
  • 実験では、両方の評価パラダイムを用いてLSTMおよびCNNアーキテクチャの説明手法を比較した。

実験結果

リサーチクエスチョン

  • RQ1文における語彙・構文的整合性は、説明評価のための自動関連性ラベルを信頼性を持って生成するために利用可能か?
  • RQ2勾配ベースの説明手法は、CNNとLSTMの予測を説明する際に、メモリセル分解法と比べてどれほど効果的か?
  • RQ3ハイブリッドドキュメント評価において、LIMSSEは標準LIMEに比べてどの程度説明品質を向上させるか?
  • RQ4ハイブリッドドキュメントは、人手によるアノテーションなしに、信頼性がありスケーラブルなベンチマークとして機能できるか?
  • RQ5さまざまな説明手法は、言語的構造から自動生成された関連性信号とどの程度整合するか?

主な発見

  • Denilら(2014)が提案した勾配ベースの説明手法は、畳み込みニューラルネットワークに対して最も正確な説明を生成した。
  • MurdochとSzlam(2017)が導入したメモリセル分解法は、長短期記憶ネットワークに対して最も効果的な説明をもたらした。
  • LIMSSE—LIMEのサブストリングベースの拡張—は、ハイブリッドドキュメント評価パラダイムで最高のパフォーマンスを達成した。
  • 語彙・構文的整合性の活用により、人手によるアノテーションなしに信頼性のある自動関連性真値を生成可能であった。
  • ハイブリッドドキュメントパラダイムは、NLPにおける説明手法の評価に向け、スケーラブルで再現可能なベンチマークを提供した。
  • 提案された2つの評価パラダイムは、両方とも高品質な説明手法を的確に同定でき、自動評価における有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。