Skip to main content
QUICK REVIEW

[論文レビュー] Can I trust you more? Model-Agnostic Hierarchical Explanations

Michael Tsang, Youbang Sun|arXiv (Cornell University)|Dec 12, 2018
Explainable Artificial Intelligence (XAI)参考文献 36被引用数 15
ひとこと要約

Mahéは、深層ニューラルネットワークなどのブラックボックスモデルにおける相互作用の階層的で文脈依存・文脈フリーの説明を生成するモデルに依存しないフレームワークを提案する。局所的摂動とニューラルネットワークフィッティングを組み合わせて相互作用を検出するとともに、一貫した局所的相互作用を一般化してグローバルで文脈フリーの行動を特定することで、局所的相互作用解釈において最先端の手法を上回り、性能の著しい低下を伴わずに文脈フリーの相互作用を同定・編集可能な初めての手法である。

ABSTRACT

Interactions such as double negation in sentences and scene interactions in images are common forms of complex dependencies captured by state-of-the-art machine learning models. We propose Mahé, a novel approach to provide Model-agnostic hierarchical éxplanations of how powerful machine learning models, such as deep neural networks, capture these interactions as either dependent on or free of the context of data instances. Specifically, Mahé provides context-dependent explanations by a novel local interpretation algorithm that effectively captures any-order interactions, and obtains context-free explanations through generalizing context-dependent interactions to explain global behaviors. Experimental results show that Mahé obtains improved local interaction interpretations over state-of-the-art methods and successfully explains interactions that are context-free.

研究の動機と目的

  • 最新のモデル(例:深層ニューラルネットワーク)が捉える複雑な依存関係、特に相互作用の説明の不足に対処すること。
  • インスタンス固有の文脈依存表現(instance-specific)と、グローバルで一貫した文脈フリー表現(global, invariant across instances)を区別すること。
  • 摂動と非線形フィッティングを用いて、特徴量の相互作用に関する正確で階層的な局所的説明を提供する手法を開発すること。
  • 局所的相互作用を一般化してグローバルで文脈フリーの説明を導出し、モデル内に存在する不変な行動パターンを明らかにすること。
  • 特定の相互作用位置でのモデル行動を微調整できるようにし、性能の低下を最小限に抑えてモデル編集を可能にすること。

提案手法

  • Mahéは、データインスタンスの周囲で局所的摂動を実行し、その結果得られる代替予測をニューラルネットワークでフィッティングすることで、非線形意思決定境界を捉え、相互作用を検出する。
  • 階層的解釈形式を用いて、複数のレベルでグループ化された特徴量の相互作用を表現し、各相互作用ごとに帰属スコアを可視化する。
  • 文脈フリーの説明では、複数のデータインスタンスにわたる一貫した相互作用パターンを一般化し、局所的相互作用がグローバルにどのように振る舞うかを特定する。
  • モデル行動を特定の相互作用位置で変更できる微分可能目的関数を用い、性能低下を最小限に抑えたターゲット編集を可能にする。
  • 高次元の特徴空間における相互作用を同定するために、NID(Nonlinear Interaction Detection)アルゴリズムの変種を適用する。
  • フィットされた代替モデルからの帰属スコアを活用し、階層的構造で相互作用の極性と大きさをランク付け・可視化する。

実験結果

リサーチクエスチョン

  • RQ1非線形代替モデルを線形近似の代わりに用いることで、複雑なモデルにおける局所的相互作用解釈の正確性を向上させられるか?
  • RQ2データインスタンスにわたって一貫する、すなわち文脈フリーの相互作用を同定でき、その行動の一貫性はどの程度か?
  • RQ3深層学習モデルにおいて、文脈フリーの相互作用を編集しても顕著な性能低下を引き起こさないか?
  • RQ4多様なデータモダリティ(NLP、ビジョン、ゲノム)において、文脈依存と文脈フリーの相互作用がモデル予測への寄与にどのように異なるか?
  • RQ5階層的説明は、NLP、ビジョン、ゲノムタスクにおいて、複雑で多段階の依存関係をどの程度明らかにできるか?

主な発見

  • Mahéは、線形LIME(最大R² = 0.621)と比較して、局所的相互作用説明において最大0.926まで高いR²適合スコアを達成し、非線形相互作用のモデリング能力に優れていることが示された。
  • 感情分類タスクでは、Mahéは文脈フリーの相互作用「not bad」を一貫して肯定的と正しく同定し、インスタンス間で帰属極性が保持された。
  • Transformerモデルで文脈フリーの「cet」相互作用の極性を反転させた後、BLEUスコアはわずかに-2.7%低下にとどまり、性能の著しい低下は見られなかった。
  • DNA-CNNでは、6ウェイのCACGTGモチーフ相互作用の全94検出で、DNA-タンパク質親和性に対して正の帰属スコアが得られ、cosine distance σ = 0.35 および σ′ = 0.408 で編集後に極性が正常に反転した。
  • ResNet152では、cosine distance σ = 0.4 および σ′ = 0.663 で文脈フリー相互作用が検出されたが、スーパーピクセルセグメンテーションに起因するアーティファクトが解釈性を低下させた。
  • フレームワークは、NLP(Sentiment-LSTM)およびビジョン(ResNet152)タスクの両方で階層的相互作用帰属を成功裏に可視化し、色分けされた極性(シアン:正、赤:負)で寄与の方向性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。