Skip to main content
QUICK REVIEW

[论文解读] Identifying Interpretable Subspaces in Image Representations

Neha Kalibhat, Shweta Bhardwaj|arXiv (Cornell University)|Jul 20, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用 3
一句话总结

FALCON 是一种模型无关的框架,通过使用预训练视觉-语言模型的对比性字幕生成,自动解释深度图像表征特征。通过分析 CLIP 嵌入和自然语言字幕中的高激活与低激活图像区域,它识别出共享的、人类可理解的概念——揭示了组群式特征解释相比单个特征,能产生显著更可解释的表征。

ABSTRACT

We propose Automatic Feature Explanation using Contrasting Concepts (FALCON), an interpretability framework to explain features of image representations. For a target feature, FALCON captions its highly activating cropped images using a large captioning dataset (like LAION-400m) and a pre-trained vision-language model like CLIP. Each word among the captions is scored and ranked leading to a small number of shared, human-understandable concepts that closely describe the target feature. FALCON also applies contrastive interpretation using lowly activating (counterfactual) images, to eliminate spurious concepts. Although many existing approaches interpret features independently, we observe in state-of-the-art self-supervised and supervised models, that less than 20% of the representation space can be explained by individual features. We show that features in larger spaces become more interpretable when studied in groups and can be explained with high-order scoring concepts through FALCON. We discuss how extracted concepts can be used to explain and debug failures in downstream tasks. Finally, we present a technique to transfer concepts from one (explainable) representation space to another unseen representation space by learning a simple linear transformation. Code available at https://github.com/NehaKalibhat/falcon-explain.

研究动机与目标

  • 开发一种自动、可扩展的方法,用于解释深度图像表征中的特征,而无需依赖人工标注数据集或人工检查。
  • 通过展示组群式特征分析能产生更可解释、更稳健的解释,解决现有方法仅孤立解释特征的局限性。
  • 通过使用低激活(反事实)图像过滤掉虚假概念,实现对比性解释。
  • 通过简单的线性变换,将在一个预训练视觉模型中学习到的概念迁移至其他模型,实现解释的复用。
  • 证明自监督和监督模型编码了相似的高层概念,表明不同架构间存在共享的表征不变性。

提出的方法

  • 针对目标特征,FALCON 使用基于梯度的显著性图,从探测数据集(如 ImageNet)中识别出高激活图像。
  • 从这些图像中裁剪显著区域,并为每个裁剪区域计算 CLIP 图像嵌入。
  • 利用大规模字幕数据集(如 LAION-400M),通过余弦相似度将每个裁剪图像嵌入与最相似的文本嵌入匹配,以检索最佳字幕。
  • 通过词语评分机制对这些字幕中的词语进行评分和排序,由概念提取模块识别出共享的、人类可理解的概念。
  • 通过同时对低激活(反事实)图像进行字幕生成,并过滤掉在这些图像中频繁出现的概念,应用对比性解释,从而减少虚假关联。
  • 学习一个线性变换,将源表征空间(如 SimCLR)中的概念映射到未见过的目标空间(如 MoCo),实现跨模型解释迁移。

实验结果

研究问题

  • RQ1我们能否在无需人工标注数据的情况下,自动为深度图像表征中的单个特征生成人类可理解的自然语言解释?
  • RQ2与单独解释单个特征相比,组群式特征解释在可解释性和鲁棒性方面表现如何?
  • RQ3使用低激活图像进行对比性解释能否有效过滤掉虚假或无关的概念?
  • RQ4从一个预训练视觉模型中提取的概念,能在多大程度上通过线性变换迁移到另一个未见过的模型上?
  • RQ5自监督和监督模型是否编码了相似的高层概念,提示架构间存在共享的表征先验?

主要发现

  • 在最先进的自监督和监督模型中,表征空间中不到 20% 的部分能通过单个特征有意义地解释,表明单变量解释存在局限性。
  • 组群式特征分析显著提升了可解释性,使我们能够发现单个特征无法表达的高阶、多维度概念。
  • 对比性解释能有效过滤虚假概念,提高了所提取解释的可靠性和准确性。
  • 该框架通过学习的线性变换,成功地将概念从源模型(如 SimCLR)迁移到未见过的目标模型(如 MoCo),且目标模型中激活最高的图像与原始概念高度匹配。
  • FALCON 发现,采用不同预训练方式(自监督与监督)训练的模型编码了大量相似的高层概念,提示不同架构间存在共享的表征先验。
  • 该方法实现了可扩展的、自动化的特征解释,支持在分类、目标检测和分割等下游任务中的调试与分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。