Skip to main content
QUICK REVIEW

[论文解读] A Formal Framework to Characterize Interpretability of Procedures

Amit Dhurandhar, Vijay S. Iyengar|arXiv (Cornell University)|Jul 12, 2017
Explainable Artificial Intelligence (XAI)参考文献 16被引用 15
一句话总结

本文提出了一种基于 $δ$-可解释性的形式化框架,将可解释性定义为相对于目标模型(TM)而非仅人类的属性。通过衡量在获得某项程序信息后目标模型性能的提升($\geq\delta$),该框架量化了可解释性,从而实现对不同方法在准确性、鲁棒性和适用于各类模型(包括人类、线性模型或复杂系统)方面的比较。

ABSTRACT

We provide a novel notion of what it means to be interpretable, looking past the usual association with human understanding. Our key insight is that interpretability is not an absolute concept and so we define it relative to a target model, which may or may not be a human. We define a framework that allows for comparing interpretable procedures by linking it to important practical aspects such as accuracy and robustness. We characterize many of the current state-of-the-art interpretable methods in our framework portraying its general applicability.

研究动机与目标

  • 将可解释性重新定义为非人类中心的属性,而是一种与目标模型(TM)相关的、基于性能的概念。
  • 提供一个形式化且可推广的框架,使不同目标模型(TM)下的可解释性方法在准确性、鲁棒性和实用性方面得以比较。
  • 通过在医疗保健和恶意软件检测等现实场景中表征最先进的可解释方法,展示该框架的适用性。
  • 使可解释性的评估超越人类理解的范畴,包括目标模型为机器学习模型或具备超人类能力的系统的情形。
  • 以可测量的性能提升($\delta$)和在分布偏移或对抗性条件下保持的鲁棒性($\gamma$)来形式化可解释性。

提出的方法

  • 将 $δ$-可解释性定义为一种程序 $P_I$,该程序在目标分布 $D_T$ 上使目标模型 $M_T$ 的性能提升至少 $\delta$。
  • 将可解释性视为一种通信任务:该程序必须以目标模型可处理的格式传输信息,例如特征权重或选定的特征。
  • 通过将 $D_T$ 定义为基础分布或聚焦于特征空间特定区域的重加权版本,同时支持全局和局部可解释性。
  • 引入 $\gamma$-可解释性以增强鲁棒性,确保在分布偏移或对抗性扰动下性能提升依然成立。
  • 使用医疗保健示例(Chang & Weiner, 2010)说明如何通过特征映射,使一个复杂的264维模型对一个简单的32维线性目标模型实现 $δ$-可解释性。
  • 将框架扩展至多个分布和灵敏度阈值($\alpha$),以定义具有相似可解释性性能的模型等价类。

实验结果

研究问题

  • RQ1如何以一种独立于人类理解的方式,正式定义可解释性,并使其适用于任何目标模型?
  • RQ2可解释性中的性能提升($\delta$)是什么,如何在不同类型的目标模型上进行测量?
  • RQ3当目标模型不是人类时(如线性模型或神经网络),是否可以对不同方法的可解释性进行有意义的比较?
  • RQ4鲁棒性($\gamma$)在可解释性中起什么作用,它在何种情况下成为关键关注点?
  • RQ5该框架在多大程度上能通过灵敏度阈值($\alpha$)涵盖局部可解释性、分布偏移和操作意义?

主要发现

  • 该框架成功表征了现有可解释方法(如医疗保健中的ACG系统和恶意软件检测中的方法),通过量化其相对于目标模型的性能提升($\delta$)。
  • 在医疗保健示例中,264维的EDC模型通过特征映射被转化为对32维线性模型(ADG系统)的 $δ$-可解释性,使平均绝对预测误差(MAPE)显著降低。
  • 该框架揭示了可解释性并非与模型复杂度固有相关;即使深层模型,只要能使目标模型性能提升 $\delta$,就可被视为可解释。
  • 鲁棒性($\gamma$)仅在测试集不完整时成为关注重点,凸显了在评估可解释性时分布假设的重要性。
  • 该框架通过灵敏度阈值 $\alpha$ 允许定义模型的等价类,从而实现对不同方法可解释性性能的操作性比较。
  • 该方法超越了以人类为中心的可解释性,使对非人类目标模型(如线性模型、决策树或超人类系统)的可解释性评估成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。