Skip to main content
QUICK REVIEW

[论文解读] "I know it when I see it". Visualization and Intuitive Interpretability

Fabian Offert|arXiv (Cornell University)|Nov 20, 2017
Explainable Artificial Intelligence (XAI)参考文献 17被引用 5
一句话总结

本文主张,机器学习中的直观可解释性从根本上受限于依赖降维和正则化的可视化技术,这些技术通过用正面的、自然主义的图像表示取代非概念(即抽象的、分布式语义状态),引入了人类偏见。核心贡献在于揭示此类可视化如何扭曲模型语义,尤其是在表示非概念(如“非色情”)时,并倡导采用多图像、多元化的表示方式,以替代单一、具有误导性的可视化。

ABSTRACT

Most research on the interpretability of machine learning systems focuses on the development of a more rigorous notion of interpretability. I suggest that a better understanding of the deficiencies of the intuitive notion of interpretability is needed as well. I show that visualization enables but also impedes intuitive interpretability, as it presupposes two levels of technical pre-interpretation: dimensionality reduction and regularization. Furthermore, I argue that the use of positive concepts to emulate the distributed semantic structure of machine learning models introduces a significant human bias into the model. As a consequence, I suggest that, if intuitive interpretability is needed, singular representations of internal model states should be avoided.

研究动机与目标

  • 调查机器学习中直观可解释性的哲学与技术局限。
  • 分析降维和正则化等可视化技术如何预先解释模型的内部状态。
  • 揭示当非概念(例如“非NSFW”)被表示为正面视觉概念时,所引入的人类审美偏见。
  • 主张对模型内部状态的单一可视化本质上具有误导性,应以多元化的表示方式取而代之。
  • 强调将分布式语义结构表示为孤立、可解释图像所带来的后果。

提出的方法

  • 分析激活最大化作为一种可视化方法,通过生成图像以最大化神经元激活。
  • 应用降维技术,将高维模型状态投影到二维或三维以供人类感知。
  • 使用带有自然图像先验的正则化方法,从抽象激活生成“自然”的预图像。
  • 采用生成对抗网络(GANs)以提升可视化输出的多样性与真实感。
  • 通过分析 open_nsfw 模型,展示负向概念(如“非NSFW”)如何被可视化为正面的田园风光。
  • 借鉴德里达的“延异”(différance)概念,将分布式语义结构视为无法被单一表征所涵盖的非概念。

实验结果

研究问题

  • RQ1机器学习中的可视化如何通过降维和正则化,隐式地预先解释模型状态?
  • RQ2为何非概念(如“非色情”)在机器学习模型中难以直观表示?
  • RQ3将非概念表示为正面视觉概念在多大程度上会引入人类审美偏见,影响模型可解释性?
  • RQ4像词嵌入这样的模型中的分布式语义结构为何抗拒单一、基于概念的解释?
  • RQ5使用单一可视化来表示神经网络中复杂、非概念性的内部状态会带来什么后果?

主要发现

  • 机器学习模型的可视化需要两个层次的预解释:降维和正则化,二者均扭曲了原始的高维、非概念性状态。
  • 激活最大化在无正则化时通常产生噪声或无意义的图案,因此必须借助自然图像先验来生成可解释的输出。
  • 由此产生的可视化并非模型内部状态的直接表示,而是受到人类审美假设的影响,例如将“非色情”表示为田园风光。
  • open_nsfw 案例研究显示,尽管“SFW”(适合工作场所)概念是通过否定定义的,但其模型内部却隐式地将其训练为正面的视觉概念——即田园风光。
  • 像词嵌入这样的模型中的分布式语义结构无法被简化为单一、确定的概念,因为类比问题的解本质上是关系性的、非概念性的。
  • 对内部状态的单一可视化无法充分捕捉非概念的真实本质,因此必须采用多元、多维的可视化方式作为必要替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。