Skip to main content
QUICK REVIEW

[論文レビュー] Influence-Directed Explanations for Deep Convolutional Networks

K. Rustan M. Leino, Shayak Sen|arXiv (Cornell University)|Feb 11, 2018
Explainable Artificial Intelligence (XAI)参考文献 15被引用数 6
ひとこと要約

この論文は、内部ニューロンにおける分布的インパクトを測定することで、深層畳み込みニューラルネットワークの影響指向説明を導入し、モデルの行動を形作る高レベルの概念を同定する。この説明は複数のインスタンスに一般化でき、学習されたクラスの『本質』を抽出し、類似したカテゴリを区別するための特徴を特定する。これにより、入力レベルの帰属割り当て手法を上回る。

ABSTRACT

We study the problem of explaining a rich class of behavioral properties of deep neural networks. Distinctively, our influence-directed explanations approach this problem by peering inside the network to identify neurons with high influence on a quantity and distribution of interest, using an axiomatically-justified influence measure, and then providing an interpretation for the concepts these neurons represent. We evaluate our approach by demonstrating a number of its unique capabilities on convolutional neural networks trained on ImageNet. Our evaluation demonstrates that influence-directed explanations (1) identify influential concepts that generalize across instances, (2) can be used to extract the "essence" of what the network learned about a class, and (3) isolate individual features the network uses to make decisions and distinguish related classes.

研究の動機と目的

  • 深層畳み込みニューラルネットワークの不透明性に対処し、個々の入力インスタンスを超えて一般化する説明を提供すること。
  • 特定の分布に対してモデル行動に影響を与える内部ニューロンが学習した高レベルで一般化可能な概念を同定すること。
  • 内部インパクトの測定と解釈技術を組み合わせ、ニューロンの行動とモデル意思決定を結びつける説明を生み出すこと。
  • 入力空間のばらつきにより一般化に失敗する入力レベルの帰属割り当て手法の限界を克服すること。
  • 自然な公理を満たし、モデル行動の忠実な説明を可能にする理論的裏付けのあるインパクト測定を提供すること。

提案手法

  • ネットワークスライスにおける関心の対象となる数量の偏微分として定義される分布的インパクト測定を提案し、関心のある分布上で平均化する。
  • インパクト測定を用いて、特定の分布(例:すべての「ネコ」の画像やクラス固有のサブセット)に対してモデル行動に大きな影響を与えるニューロンを同定する。
  • 可視化技術(例:活性化最大化)を用いて、最も影響力のあるニューロンが表現する概念を解釈する。
  • スライス、関心の対象、関心のある分布を柔軟に指定できるパラメータ化されたインパクトフレームワークを採用し、異なる行動的特性を標的にする。
  • 公理的根拠を提示し、線形性や一貫性などの自然な性質を満たす唯一の家族であることを示す。
  • インパクト測定と既存の解釈ツールを組み合わせ、行動的に関連性があり意味的に明確な説明を生み出す。

実験結果

リサーチクエスチョン

  • RQ1内部ニューロンにおけるインパクトを測定することで、入力レベルの帰属割り当てとは異なり、複数の入力インスタンスに一般化する説明が得られるか?
  • RQ2影響指向説明は、『スポーツカー』と『オープンカー』のような特定のクラスの表現の『本質』を抽出できるか?
  • RQ3この手法は、意味的に類似したクラスを区別するためにネットワークが使用する高レベルの特徴を特定できるか?
  • RQ4分布的インパクトは、Integrated Gradientsなどの入力レベルの帰属割り当て手法と比較して、意味のある概念を同定する上で優れているか?
  • RQ5提案されたインパクト測定は、望ましい理論的公理を満たしているか、かつモデルの分布上での行動に忠実であるか?

主な発見

  • 影響指向説明は、ピクセルレベルの寄与のばらつきが高いため、入力インパクト手法が失敗する中で、インスタンスに一般化する影響力のある概念を成功裏に同定する。
  • この手法は、『スポーツカー』と『オープンカー』の区別に重要な役割を果たす、車の屋根の形状といったコアな特徴を表すニューロンを同定することで、クラスの『本質』を抽出する。
  • 影響指向説明は、モデルが意思決定に使用する高レベルの特徴(例:車の上部)を特定し、意味的に明確でインスタンス間で一貫性がある。
  • 視覚化の整合性と解釈可能性が高いため、活性化に基づく関連性手法(例:Oramas et al.)よりも、重要なニューロンを同定する点で優れている。
  • 分布的インパクト測定は理論的に裏付けられており、重要な公理を満たしており、帰属に基づく手法の信頼性の高い代替手段である。
  • ImageNetにおける実験結果から、影響指向説明は従来の入力レベルの説明技術よりも、モデル行動に対する忠実で解釈可能な洞察を提供することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。