Skip to main content
QUICK REVIEW

[论文解读] Analyzing the Interpretability Robustness of Self-Explaining Models

Haizhong Zheng, Earlence Fernandes|arXiv (Cornell University)|May 27, 2019
Explainable Artificial Intelligence (XAI)参考文献 11被引用 4
一句话总结

本文研究了自解释模型(SEMs)的可解释性鲁棒性,表明尽管其设计旨在实现稳定的解释,SEMs 仍容易受到对抗性扰动的影响,这些扰动在保持模型预测不变的同时,会显著改变可解释的基础概念。主要贡献在于识别出第一阶段特征提取函数 $h(x)$ 缺乏鲁棒性是根本原因,呼吁未来工作加强对基础概念生成过程的鲁棒性约束。

ABSTRACT

Recently, interpretable models called self-explaining models (SEMs) have been proposed with the goal of providing interpretability robustness. We evaluate the interpretability robustness of SEMs and show that explanations provided by SEMs as currently proposed are not robust to adversarial inputs. Specifically, we successfully created adversarial inputs that do not change the model outputs but cause significant changes in the explanations. We find that even though current SEMs use stable co-efficients for mapping explanations to output labels, they do not consider the robustness of the first stage of the model that creates interpretable basis concepts from the input, leading to non-robust explanations. Our work makes a case for future work to start examining how to generate interpretable basis concepts in a robust way.

研究动机与目标

  • 评估自解释模型(SEMs)在对抗性输入扰动下是否能实现可解释性鲁棒性。
  • 探究 SEMs 对于保持模型输出不变但改变解释的对抗性攻击的脆弱性。
  • 识别当前 SEMs 中可解释性脆弱性的根本原因,特别是负责生成可解释基础概念的第一阶段函数 $h(x)$。
  • 倡导未来研究应聚焦于提升 $h(x)$ 对输入扰动的鲁棒性。
  • 提出新方向,通过在 $h(x)$ 上引入对抗性训练和局部-Lipschitz约束来改进 SEMs。

提出的方法

  • 设计并实现一种有针对性的对抗性攻击,以在保持模型输出的同时最大化可解释基础概念 $h(x)$ 的变化。
  • 使用 $L_∞$ 范数($\epsilon = 0.3$)的投影梯度下降法(PGD)生成 SENNs 和 PrototypeDL 的对抗性样本。
  • 定义距离度量 $D(x,y)$ 以衡量输入表示与学习到的原型之间的相似性,评估解释的一致性。
  • 通过比较对抗性样本与自然样本在类内和类外样本中 $h(x)$ 的 $l_2$-范数距离,评估对抗性鲁棒性。
  • 应用局部-Lipschitz稳定性度量 $\hat{L}(x)$,量化解释系数 $\theta(x)$ 对输入变化的敏感性。
  • 在 MNIST 数据集上训练和测试 SEMs,使用自然输入和对抗性扰动输入,比较解释的一致性。

实验结果

研究问题

  • RQ1自解释模型(SEMs)是否对保留模型预测但改变解释的对抗性扰动具有鲁棒性?
  • RQ2负责提取可解释基础概念的第一阶段函数 $h(x)$,是否对微小输入扰动表现出足够的鲁棒性?
  • RQ3能否设计出对抗性攻击,使 SEMs 对同一预测标签生成显著不同的解释?
  • RQ4在 PrototypeDL 中,对抗性样本与原型之间的距离与自然样本相比如何?
  • RQ5当 $h(x)$ 未施加稳定性约束时,SEMs 的可解释性鲁棒性在多大程度上会崩溃?

主要发现

  • 能够保持模型输出不变的对抗性扰动,可导致可解释基础概念 $h(x)$ 发生剧烈变化,表明可解释性鲁棒性失效。
  • 在 $h(x)$-空间中,对抗性类外距离小于自然类内距离,表明对抗性样本常使 $h(x)$ 表现出不同类别的特征。
  • 在 PrototypeDL 中,发现对抗性样本到错误原型的距离小于到正确原型的距离,导致产生误导性解释(例如,数字 '2' 被解释为类似 '0')。
  • 对抗性样本的 $D(x^*,y)$ 和 $\min_{y' \neq y} D(x^*,y')$ 分布在正确和错误标签之间无明显区分,表明解释保真度丧失。
  • 局部-Lipschitz度量 $\hat{L}(x)$ 揭示 $\theta(x)$ 保持稳定,但不稳定性源于 $h(x)$,确认第一阶段特征提取器是薄弱环节。
  • 结果表明,尽管 $\theta(x)$ 具备稳定性保证,当前 SEMs 在 $h(x)$ 组件上仍缺乏鲁棒性,未来工作必须聚焦于稳定化 $h(x)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。