Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning of Neural Networks to Explain Neural Networks

Quanshi Zhang, Yang Yu|arXiv (Cornell University)|May 18, 2018
Explainable Artificial Intelligence (XAI)参考文献 43被引用数 17
ひとこと要約

この論文は、ラベルデータを一切使用せずに、事前学習済み畳み込みニューラルネットワーク(CNN)の特徴マップを解釈可能なオブジェクト部品表現に分離する非教師付き説明ネットワークを提案する。知識蒸留を用いることで、説明ネットワークは高層特徴を再構築するとともに、各フィルタが1つのオブジェクト部品を表すように制約を課し、解釈性を著しく向上させる。VGGベースの説明ネットワークでは、特徴マップの80%以上が解釈可能な部品からの活性化を示しており、情報損失は最小限に抑えられている。

ABSTRACT

This paper presents an unsupervised method to learn a neural network, namely an explainer, to interpret a pre-trained convolutional neural network (CNN), i.e., explaining knowledge representations hidden in middle conv-layers of the CNN. Given feature maps of a certain conv-layer of the CNN, the explainer performs like an auto-encoder, which first disentangles the feature maps into object-part features and then inverts object-part features back to features of higher conv-layers of the CNN. More specifically, the explainer contains interpretable conv-layers, where each filter disentangles the representation of a specific object part from chaotic input feature maps. As a paraphrase of CNN features, the disentangled representations of object parts help people understand the logic inside the CNN. We also learn the explainer to use object-part features to reconstruct features of higher CNN layers, in order to minimize loss of information during the feature disentanglement. More crucially, we learn the explainer via network distillation without using any annotations of sample labels, object parts, or textures for supervision. We have applied our method to different types of CNNs for evaluation, and explainers have significantly boosted the interpretability of CNN features.

研究の動機と目的

  • 特に中層特徴マップが混沌として直感的でないため、深層CNNにおける解釈性の欠如に取り組む。
  • アノテーションに依存せず、事前学習済みCNNから人間が解釈可能なオブジェクト部品特徴を自動的に同定・抽出する手法を開発する。
  • 元のCNNの分類性能を維持しつつ、補助的説明ネットワークを用いて特徴の解釈性を向上させる。
  • ユーザーが特定の予測に対してどのオブジェクト部品がエンコードされ、活性化しているかを理解できるようにし、モデル意思決定への信頼を高める。
  • 特徴の分離の過程で情報損失を最小限に抑えるために、蒸留により高層特徴を再構築するように説明ネットワークを訓練する。

提案手法

  • 事前学習済みCNN(パフォーマー)に接続された軽量オートエンコーダーとしての説明ネットワークを訓練するが、パフォーマーのアーキテクチャに変更を加えない。
  • 説明ネットワークのエンコーダーに解釈可能な畳み込みフィルタを用い、各フィルタが1つのオブジェクト部品を表すように制約を課す。
  • フィルタ損失関数を新たに設計し、各フィルタが物体の特定の一貫した領域(例:左目、複数の繰り返しエッジではない)にのみ活性化するように促進する。
  • 知識蒸留を用いて説明ネットワークを訓練:説明ネットワークの復元特徴とパフォーマーの高層特徴マップとの間の再構築損失を最小化する。
  • 受容 field 視覚化とGrad-CAMを用い、解釈可能なフィルタが特定の意味的意味のあるオブジェクト部品(頭部、首、胴体など)に注目していることを検証する。
  • 説明ネットワークの解釈可能な特徴による分類スコア寄与割合を測る定量的指標「p値」を導入する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしで、混沌としている中層特徴マップから、人間が解釈可能なオブジェクト部品表現を自動的に発見・分離できるか?
  • RQ2非教師付き説明ネットワークは、意味的解釈性を保持しつつ、元のCNN特徴マップをどの程度再構築できるか?
  • RQ3フィルタ損失関数は、テクスチャ的パターンや繰り返しパターンではなく、部品特化型特徴の学習をどのように促進するか?
  • RQ4解釈可能な特徴が最終分類意思決定にどの程度寄与しているかを定量的に評価すると、元のCNNと比較してどうなるか?
  • RQ5説明ネットワークは、特定の予測に対してどのオブジェクト部品が活性化しているかを診断し、モデルの透明性を向上させることができるか?

主な発見

  • VGGベースの説明ネットワークでは、特徴マップの80%以上が解釈可能なフィルタからの活性化スコアを示しており、オブジェクト部品の強い分離が確認された。
  • 説明ネットワークは高い再構築忠実度を達成した:再構築特徴上の分類精度は元のパフォーマーの精度と1〜4%の差に留まり、Δエラー(損失)も1〜4%にとどまった。
  • フィルタ損失は、各フィルタが1つのオブジェクト部品を表すよう効果的に促進した。Grad-CAMの注目マップは、頭部、首、胴体など明確で意味的意味のある領域に注目していることが示された。
  • 説明ネットワークは、鳥の頭部、首、胴体に対してそれぞれ58、167、243個のフィルタを学習し、構造的で部品ベースの表現を学習可能であることを示した。
  • 分類損失で訓練された「Explainer+cls」ベースラインは、パフォーマーを上回る分類性能を示した。これは、異なる目的関数で訓練された説明ネットワークが、元のモデルを上回る性能を達成可能であることを示唆している。
  • 受容 field 視覚化により、解釈可能なフィルタは局所的で一貫性のある受容 field を示し、オブジェクト部品と一致していた。一方、通常のフィルタは広範でテクスチャに敏感な応答を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。