Skip to main content
QUICK REVIEW

[论文解读] In-Distribution Interpretability for Challenging Modalities

Cosmas Heiß, Ron Levie|arXiv (Cornell University)|Jul 1, 2020
Explainable Artificial Intelligence (XAI)参考文献 18被引用 5
一句话总结

该论文提出了一种与领域无关的、基于生成对抗网络(GAN)的分布内解释方法,利用生成式修复技术为音乐和城市物理模拟等复杂模态中的深度学习模型生成忠实且有意义的解释。通过在真实数据分布约束下保持模型预测不变,该方法识别出对预测结果起关键作用的输入组件(如建筑物或信号测量值),相较于标准的遮挡方法,展现出更优的可解释性。

ABSTRACT

It is widely recognized that the predictions of deep neural networks are difficult to parse relative to simpler approaches. However, the development of methods to investigate the mode of operation of such models has advanced rapidly in the past few years. Recent work introduced an intuitive framework which utilizes generative models to improve on the meaningfulness of such explanations. In this work, we display the flexibility of this method to interpret diverse and challenging modalities: music and physical simulations of urban environments.

研究动机与目标

  • 解决音乐和城市模拟等复杂模态中缺乏忠实、分布感知解释的问题。
  • 通过确保扰动保持在数据流形内,避免因分布外输入导致的虚假解释,从而提升深度神经网络的可解释性。
  • 通过使用生成模型实现逼真修复,将速率-失真解释(RDE)框架扩展至非图像模态。
  • 通过识别对预测最具影响力的输入组件(如建筑物或测量值),评估物理模拟中模型的行为(例如无线电信号映射)。
  • 证明分布内扰动相比标准遮挡或随机噪声方法,能产生更可靠、更有意义的解释。

提出的方法

  • 通过使用混凝土分布对二值掩码 $ s \in \{0,1\}^d $ 进行可微分、连续的松弛,以优化稀疏性和相关性。
  • 对掩码 $ s $ 应用 $ \ell_1 $-正则化,以促进其在 0 或 1 处饱和,从而生成稀疏且可解释的组件。
  • 采用训练好的基于 GAN 的修复网络 $ G $,生成逼真的遮蔽输入 $ z = x \odot s + G(x,s,n) \odot (1-s) $,确保 $ z $ 保持在分布内。
  • 使用温度控制采样优化损失函数 $ L'(s) = \frac{1}{2}\mathbb{E}_{z\sim\Upsilon_s}[(\Phi_d(x) - \Phi_d(z))^2] + \lambda \|s\|_1 $,采用随机梯度下降(SGD)。
  • 使用匹配追踪算法,迭代识别出能保持模型预测不变的最小输入组件集合(如建筑物或信号测量值)。
  • 将该方法应用于两个具有挑战性的模态:音乐生成和城市环境中无线电信号映射,分别采用黑箱和基于模型的修复方法。

实验结果

研究问题

  • RQ1如何为音乐和物理模拟等非图像模态中的深度学习模型生成忠实且分布内(in-distribution)的解释?
  • RQ2与随机或背景色遮挡相比,使用基于 GAN 的修复网络在多大程度上提升了模型解释的合理性?
  • RQ3在无线电信号预测模型的决策过程中,哪些输入组件(建筑物或信号测量值)最具影响力?
  • RQ4所提方法能否区分模型行为中的全局结构模式(如建筑物布局)与局部信号测量值?
  • RQ5在复杂模拟中,修复策略的选择(如基于模型的修复 vs. 随机修复)如何影响预测的可解释性?

主要发现

  • 该方法成功识别出:当缺少建筑物时,其阴影区域的信号测量值对预测无线电图中的暗点至关重要,表明模型推断出了建筑物的存在。
  • 在解释亮区时,模型依赖于与发射机视线对齐的测量值,解释结果表明模型避免预测过大的遮挡物。
  • 使用 $ \Phi_{\text{gt}} $ 的基于模型的修复方法,相比随机或朴素修复方法,能生成更逼真、更可靠的解释,尤其在高对比度区域表现更优。
  • 基于 GAN 的修复确保了遮蔽输入保持在数据流形内,降低了因分布外扰动导致虚假解释的风险。
  • 该方法识别出全局结构组件(如建筑物布局)比局部信号点更具影响力,这与 UNet 架构的全局特征提取能力一致。
  • 在无线电图任务中,优化后的掩码正确地突出了:根据查询上下文的不同,阴影区和视距内的测量值均具有决定性作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。