Skip to main content
QUICK REVIEW

[論文レビュー] Looking Deeper into Deep Learning Model: Attribution-based Explanations of TextCNN

Wenting Xiong, Iftitahu Ni’mah|arXiv (Cornell University)|Nov 8, 2018
Explainable Artificial Intelligence (XAI)参考文献 9被引用数 7
ひとこと要約

本稿では、テキスト分類のTextCNNにおける帰属度手法—Layer-wise Relevance Propagation (LRP) とサリエンシー・マップ—を評価するための特徴ベースの摂動フレームワークを提案する。従来の語削除手法に代わり、中間畳み込み層からの埋め込み特徴の削除を採用する。結果から、LRPはサリエンシーを上回り、関連する特徴をより適切に特定しており、帰属度の差がモデル予測の特定のクラスへのバイアスを効果的に明らかにしていることが示された。

ABSTRACT

Layer-wise Relevance Propagation (LRP) and saliency maps have been recently used to explain the predictions of Deep Learning models, specifically in the domain of text classification. Given different attribution-based explanations to highlight relevant words for a predicted class label, experiments based on word deleting perturbation is a common evaluation method. This word removal approach, however, disregards any linguistic dependencies that may exist between words or phrases in a sentence, which could semantically guide a classifier to a particular prediction. In this paper, we present a feature-based evaluation framework for comparing the two attribution methods on customer reviews (public data sets) and Customer Due Diligence (CDD) extracted reports (corporate data set). Instead of removing words based on the relevance score, we investigate perturbations based on embedded features removal from intermediate layers of Convolutional Neural Networks. Our experimental study is carried out on embedded-word, embedded-document, and embedded-ngrams explanations. Using the proposed framework, we provide a visualization tool to assist analysts in reasoning toward the model's final prediction.

研究の動機と目的

  • テキスト分類において言語的依存関係を無視する語削除摂動手法の限界を解消すること。
  • 埋め込み語、埋め込み文、埋め込みn-gram特徴を用いたCNNにおける帰属度手法の特徴ベース評価フレームワークを構築すること。
  • 公的および企業用テキストデータセットにおけるTextCNN予測の解釈性を、LRPとサリエンシー・マップの質の比較を通じて評価すること。
  • アナリストがモデル予測を解釈し、影響力のある特徴を特定するのを支援するインタラクティブ可視化ツールを構築すること。
  • 真のクラスと他のクラスとの間の帰属度差が、特定の結果に向けたモデル予測を誘導するかどうかを調査すること。

提案手法

  • 語削除摂動を、TextCNNの中間畳み込み層からの高・低帰属度特徴の削除に置き換える。
  • 畳み込みフィルタから抽出された、埋め込み語、埋め込み文、埋め込みn-gram特徴の3種類の特徴レベル帰属度を適用する。
  • LRPとサリエンシー・マップを用いて、異なる層での帰属度スコアを計算し、フィルタレベルの帰属度に焦点を当てる。
  • 帰属度スコア順に並べた特徴を削除した後のモデル精度を評価する(上位、下位、またはクラス間帰属度差に基づく)。
  • 個々の語やn-gramについて、LRP帰属度とクラス間帰属度差を表示するインタラクティブ可視化ツールを構築する。
  • 特徴を1, 3, 5, 7個と段階的に削除することで、予測精度への影響を測定するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1語削除ではなく特徴ベースの摂動を用いる場合、LRPとサリエンシー・マップはTextCNN予測の関連特徴をどのように識別するか?
  • RQ2真のクラスと他のクラスとの間の帰属度差に基づいて特徴を削除すると、モデル予測が特定の誤ったクラスに誘導されるか?
  • RQ3提案された特徴ベース評価フレームワークは、語削除手法に比べて帰属度手法の質をより効果的に測定できるか?
  • RQ4無関係な特徴を削除した場合、LRPとサリエンシー・マップはランダム削除や帰属度ベース削除と比較して、モデル精度をどれほど保持するか?
  • RQ5クラス間の帰属度差は、二値分類および多値分類タスクにおける誤分類パターンにどの程度影響を与えるか?

主な発見

  • 最も関連度の高い特徴を削除した場合、LRPベースの特徴削除はサリエンシーに比べてモデル精度を著しく低下させた。これは、LRPがより重要な特徴を特定していることを示している。
  • Yelpレビュー・データセットでは、上位5つの関連度の高いn-gram特徴を削除したところ、LRPでは99.2%の精度を維持したが、サリエンシーでは81.1%に低下した。これは、LRPの優れた特徴関連度検出能力を示している。
  • CDD企業データセットでは、上位5つの関連特徴をLRPで削除した場合、精度は97.81%に低下したが、サリエンシーでは98.90%に留まった。これにより、LRPが関連特徴に対してより感受性が強いことがさらに確認された。
  • 真のクラスとクラス2との帰属度差(例:真のクラス vs. クラス2)を用いる場合、LRPとサリエンシーの両方が予測を特定のクラスに誘導し、特にクラス2および3の誤分類率が著しく上昇した。これは、モデルバイアスの検出能力を示している。
  • 可視化ツールは、予測に寄与する重要な語やn-gramを効果的に強調表示でき、アナリストがモデルの推論を追跡し、潜在的な混同要因を特定するのを支援した。
  • 多値分類の米国消費者苦情データセットでは、真のクラスの上位15個のフィルタのLRPスコアを削除した場合、誤分類はたった7件にとどまった。一方、LRP差分(真のクラス vs. クラス2または3)に基づいて同じフィルタを削除した場合、誤分類は300件以上に増加した。これは、帰属度差による強い予測誘導効果を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。