Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Interpretable Subspaces in Image Representations

Neha Kalibhat, Shweta Bhardwaj|arXiv (Cornell University)|Jul 20, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用数 3
ひとこと要約

FALCONは、事前学習された視覚言語モデルからの対照的キャプションを用いて、深層画像表現特徴を自動で説明するモデルに依存しないフレームワークである。CLIP埋め込みと自然言語キャプションを用いて、高い活性化度と低い活性化度の画像クロップを分析することで、共有され、人間が理解可能な概念を同定する。その結果、個々の特徴よりもグループ単位での特徴解釈がはるかに解釈可能であることが明らかになった。

ABSTRACT

We propose Automatic Feature Explanation using Contrasting Concepts (FALCON), an interpretability framework to explain features of image representations. For a target feature, FALCON captions its highly activating cropped images using a large captioning dataset (like LAION-400m) and a pre-trained vision-language model like CLIP. Each word among the captions is scored and ranked leading to a small number of shared, human-understandable concepts that closely describe the target feature. FALCON also applies contrastive interpretation using lowly activating (counterfactual) images, to eliminate spurious concepts. Although many existing approaches interpret features independently, we observe in state-of-the-art self-supervised and supervised models, that less than 20% of the representation space can be explained by individual features. We show that features in larger spaces become more interpretable when studied in groups and can be explained with high-order scoring concepts through FALCON. We discuss how extracted concepts can be used to explain and debug failures in downstream tasks. Finally, we present a technique to transfer concepts from one (explainable) representation space to another unseen representation space by learning a simple linear transformation. Code available at https://github.com/NehaKalibhat/falcon-explain.

研究の動機と目的

  • 人的アノテーションデータセットや手動の検査を必要とせず、深層画像表現の特徴を自動的かつスケーラブルに解釈する手法を開発すること。
  • 従来の方法が個々の特徴を個別に解釈するという限界を克服し、グループ単位での特徴分析がより解釈可能で頑健な説明をもたらすことを示すこと。
  • 低活性化(反事実的)画像を用いて偽の関連を除外することで、対照的解釈を可能にすること。
  • 簡単な線形変換を用いて、異なる事前学習済み視覚モデル間で学習された概念を再利用可能にすること。
  • 自己教師ありと教師ありのモデルが、類似した高レベルの概念をエンコードしていることを示し、アーキテクチャを越えて共通の表現不変性がある可能性を示唆すること。

提案手法

  • ターゲット特徴に対して、FALCONは勾配ベースのサリエンシー・マップを用いてプローブデータセット(例:ImageNet)から高い活性化度を示す画像を特定する。
  • これらの画像からサリエンシー領域をクロップし、それぞれのクロップ領域に対してCLIP画像埋め込みを計算する。
  • 大規模なキャプションデータセット(例:LAION-400M)を用い、コサイン類似度により各クロップ画像埋め込みと最も類似するテキスト埋め込みを特定し、上位キャプションを取得する。
  • 語のスコアリング機構を用いて、これらのキャプションからの語をスコア付け・順位付けすることで、共有され、人間が理解可能な概念を同定する概念抽出モジュールを実装する。
  • 対照的解釈として、低活性化(反事実的)画像のキャプションも生成し、それらに頻出する概念を除外することで、誤った関連性を低減する。
  • ソース表現空間(例:SimCLR)から未確認のターゲット空間(例:MoCo)への概念のマッピングを学習する線形変換を学習し、モデル間での説明の再利用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1人的アノテーションデータを一切用いずに、深層画像表現の個々の特徴について、人間が理解可能な自然言語による説明を自動生成できるか?
  • RQ2個々の特徴の解釈と比較して、グループ単位での特徴解釈は、解釈可能性と頑健性においてどのように異なるか?
  • RQ3低活性化画像を用いた対照的解釈は、誤ったまたは関係のない概念を効果的に除外できるか?
  • RQ41つの事前学習済み視覚モデルから抽出した概念を、線形変換を用いて別の未確認のモデルにどの程度再利用できるか?
  • RQ5自己教師ありと教師ありのモデルが、類似した高レベルの概念をエンコードしているか。これは、アーキテクチャを越えて共通の表現的バイアスがある可能性を示唆するか?

主な発見

  • 最先端の自己教師ありおよび教師ありモデルの表現空間の20%未満が、個々の特徴によって意味的に説明可能であることが示され、一変量解釈の限界が明らかになった。
  • グループ単位での特徴分析は解釈性を顕著に向上させ、個々の特徴では表現できない高次の、多面的な概念の発見を可能にした。
  • 対照的解釈は誤った概念を効果的に除外し、抽出された説明の信頼性と正確性を向上させた。
  • 学習された線形変換を用いて、ソースモデル(例:SimCLR)から未確認のターゲットモデル(例:MoCo)への概念の転送に成功し、ターゲットモデルにおける上位活性化画像が元の概念と密接に一致した。
  • FALCONは、自己教師ありと教師ありの異なる事前学習方式で学習されたモデルが、大部分の類似した高レベルの概念をエンコードしていることを同定した。これは、アーキテクチャを越えて共通の表現的前提がある可能性を示唆している。
  • 本手法は、分類、オブジェクト検出、セグメンテーションなどの下流タスクにおけるデバッグや分析を支援する、スケーラブルで自動化された特徴解釈を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。