Skip to main content
QUICK REVIEW

[论文解读] Can I trust you more? Model-Agnostic Hierarchical Explanations

Michael Tsang, Youbang Sun|arXiv (Cornell University)|Dec 12, 2018
Explainable Artificial Intelligence (XAI)参考文献 36被引用 15
一句话总结

Mahé 提出了一种模型无关的框架,用于生成黑箱模型(如深度神经网络)中交互行为的分层、上下文相关及上下文无关的解释。通过结合局部扰动与神经网络拟合以检测交互行为,并将一致的局部交互推广至全局上下文无关行为,Mahé 在局部交互解释方面优于当前最先进方法,并首次实现对上下文无关交互的识别与编辑,且性能下降可忽略不计。

ABSTRACT

Interactions such as double negation in sentences and scene interactions in images are common forms of complex dependencies captured by state-of-the-art machine learning models. We propose Mahé, a novel approach to provide Model-agnostic hierarchical éxplanations of how powerful machine learning models, such as deep neural networks, capture these interactions as either dependent on or free of the context of data instances. Specifically, Mahé provides context-dependent explanations by a novel local interpretation algorithm that effectively captures any-order interactions, and obtains context-free explanations through generalizing context-dependent interactions to explain global behaviors. Experimental results show that Mahé obtains improved local interaction interpretations over state-of-the-art methods and successfully explains interactions that are context-free.

研究动机与目标

  • 为解决当前最先进模型(如深度神经网络)所捕捉的复杂依赖关系——尤其是交互行为——缺乏解释的问题。
  • 区分上下文相关表示(实例特定)与上下文无关表示(全局,跨实例不变)。
  • 开发一种方法,通过扰动与非线性拟合,实现对特征交互的准确、分层的局部解释。
  • 将局部交互推广为全局上下文无关解释,以揭示模型中不变的行为模式。
  • 通过识别并修改上下文无关交互,实现模型编辑,且性能损失最小化。

提出的方法

  • Mahé 在数据实例周围使用局部扰动生成代理预测,并通过神经网络拟合以捕捉非线性决策边界并检测交互行为。
  • 采用分层解释格式,在多个层级上表示成组特征交互,通过归因分数可视化每种交互。
  • 对于上下文无关解释,Mahé 将多个数据实例中一致的交互模式进行泛化,以判断局部交互是否具有全局行为一致性。
  • 框架使用可微目标函数,在特定交互位置修改模型行为,实现精准编辑且性能损失最小。
  • 应用改进版的 NID(非线性交互检测)算法,以识别特征空间中的高阶交互。
  • Mahé 利用拟合代理模型的归因分数对交互进行排序,并以分层形式可视化其极性和大小。

实验结果

研究问题

  • RQ1通过使用非线性代理模型而非线性近似,能否提升复杂模型中局部交互解释的准确性?
  • RQ2能否识别在数据实例间保持不变的交互行为(即上下文无关交互),其行为一致性如何?
  • RQ3能否在不引起显著性能下降的前提下,对深度学习模型中的上下文无关交互进行编辑?
  • RQ4在不同数据模态中,上下文相关与上下文无关交互在模型预测中的贡献有何差异?
  • RQ5分层解释在多大程度上能够揭示自然语言处理、视觉和基因组学任务中复杂的多层级依赖关系?

主要发现

  • 与线性 LIME(最大 R² = 0.621)相比,Mahé 在局部交互解释上实现了更高的 R² 拟合分数(最高达 0.926),证明其在建模非线性交互方面表现更优。
  • 在情感分类任务中,Mahé 正确识别出上下文无关交互 'not bad' 为始终为正向,且归因极性在所有实例中保持一致。
  • 在编辑 Transformer 模型以反转上下文无关 'cet' 交互的极性后,BLEU 分数仅下降 -2.7%,表明性能损失极小。
  • 在 DNA-CNN 中,对 6 个 CACGTG 模体交互的全部 94 次检测均显示对 DNA-蛋白质亲和力有正向归因,且在使用余弦距离 σ = 0.35 和 σ′ = 0.408 编辑后,极性成功反转。
  • 在 ResNet152 中,检测到上下文无关交互,余弦距离 σ = 0.4 和 σ′ = 0.663,但超像素分割产生的伪影降低了可解释性。
  • 该框架成功在自然语言处理(Sentiment-LSTM)和视觉(ResNet152)任务中可视化了分层交互归因,颜色编码的极性显示正向贡献(青色)或负向贡献(红色)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。