Skip to main content
QUICK REVIEW

[论文解读] An Extension of LIME with Improvement of Interpretability and Fidelity

Sheng Shi, Yangzhou Du|arXiv (Cornell University)|Apr 26, 2020
Explainable Artificial Intelligence (XAI)参考文献 12被引用 4
一句话总结

本文提出LEDSNA,作为LIME的扩展,通过基于聚类的采样方法引入特征依赖关系,并利用支持向量回归(SVR)建模非线性决策边界,从而提升局部模型的可解释性与保真度。实验表明,LEDSNA在图像和文本分类任务中均显著优于LIME,保真度更高(R²更高),近似误差更低。

ABSTRACT

While deep learning makes significant achievements in Artificial Intelligence (AI), the lack of transparency has limited its broad application in various vertical domains. Explainability is not only a gateway between AI and real world, but also a powerful feature to detect flaw of the models and bias of the data. Local Interpretable Model-agnostic Explanation (LIME) is a widely-accepted technique that explains the prediction of any classifier faithfully by learning an interpretable model locally around the predicted instance. As an extension of LIME, this paper proposes an high-interpretability and high-fidelity local explanation method, known as Local Explanation using feature Dependency Sampling and Nonlinear Approximation (LEDSNA). Given an instance being explained, LEDSNA enhances interpretability by feature sampling with intrinsic dependency. Besides, LEDSNA improves the local explanation fidelity by approximating nonlinear boundary of local decision. We evaluate our method with classification tasks in both image domain and text domain. Experiments show that LEDSNA's explanation of the back-box model achieves much better performance than original LIME in terms of interpretability and fidelity.

研究动机与目标

  • 解决LIME在扰动采样过程中处理特征相关性方面的局限性。
  • 通过建模非线性决策边界而非假设局部线性,提升局部解释的保真度。
  • 通过在采样实例中保留真实的特征依赖关系,增强可解释性。
  • 开发一种通用的、与模型无关的解释方法,适用于视觉与自然语言处理中的复杂深度学习模型。
  • 在多种分类任务中,通过保真度与可解释性指标,证明该方法相对于LIME的一致优越性。

提出的方法

  • 提出一种基于超像素聚类(图像)与词分段(文本)的特征依赖感知采样策略,生成更真实的扰动样本。
  • 利用特征聚类将相关特征分组,仅采样相关子集,降低噪声并提升局部模型质量。
  • 采用带核函数的支持向量回归(SVR)近似黑盒模型的局部非线性决策边界。
  • 通过正则化损失函数优化解释模型:$ J(\theta) = \text{argmin} \{ L(f(x), g_\theta(x)) + \lambda \Omega(\theta) \} $,在保真度与模型简洁性之间取得平衡。
  • 在SVR中使用高斯核,将数据映射到高维空间,实现有效的非线性近似。
  • 通过在目标实例周围的依赖感知扰动样本上拟合可解释模型(SVR),构建局部解释。

实验结果

研究问题

  • RQ1在采样过程中引入特征依赖关系,是否能相比LIME的均匀采样提升局部解释的质量?
  • RQ2建模非线性决策边界是否能相比假设局部线性,带来更高的局部解释保真度?
  • RQ3在不同数据模态下,该方法与LIME相比,在可解释性与保真度方面表现如何?
  • RQ4基于聚类的采样在多大程度上降低了局部解释模型的近似误差?
  • RQ5该方法是否能在图像与文本分类任务中同时保持高保真度与高可解释性?

主要发现

  • LEDSNA的局部近似误差显著低于LIME,在文本分类任务中平均误差降低了一个数量级。
  • 在图像分类任务中,LEDSNA的R²得分始终高于LIME,表明其在近似黑盒模型预测方面具有更高的保真度。
  • 在1000个测试样本中,95%的样本中LEDSNA的近似误差小于LIME,98.4%的样本中其R²高于LIME。
  • 在中文文本情感分析中,对于一个高置信度样本,LEDSNA的R²达到0.9533,误差为0.0001,显著优于LIME的R²(0.5779)与误差(0.0335)。
  • LEDSNA生成的可视化解释在特征归因方面更具实用性与准确性,尤其在捕捉文本中的语义依赖关系方面优于LIME。
  • 该方法在各类实例中表现稳健,包括高置信度与低置信度预测,证实其在真实场景中的可靠性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。