Skip to main content
QUICK REVIEW

[论文解读] Looking Deeper into Tabular LIME

Damien Garreau, Ulrike von Luxburg|arXiv (Cornell University)|Aug 25, 2020
Explainable Artificial Intelligence (XAI)参考文献 28被引用 10
一句话总结

本文对表格型LIME进行了理论分析,证明在样本量趋于无穷大时,其可解释系数可显式表示为模型参数和黑箱模型期望的函数。研究发现,LIME能正确识别线性函数和稀疏函数的相关特征,但对于CART森林等基于划分的模型,会产生误导性伪影。

ABSTRACT

In this paper, we present a thorough theoretical analysis of the default implementation of LIME in the case of tabular data. We prove that in the large sample limit, the interpretable coefficients provided by Tabular LIME can be computed in an explicit way as a function of the algorithm parameters and some expectation computations related to the black-box model. When the function to explain has some nice algebraic structure (linear, multiplicative, or sparsely depending on a subset of the coordinates), our analysis provides interesting insights into the explanations provided by LIME. These can be applied to a range of machine learning models including Gaussian kernels or CART random forests. As an example, for linear functions we show that LIME has the desirable property to provide explanations that are proportional to the coefficients of the function to explain and to ignore coordinates that are not used by the function to explain. For partition-based regressors, on the other side, we show that LIME produces undesired artifacts that may provide misleading explanations.

研究动机与目标

  • 为表格数据中表格型LIME的默认实现提供严格的理论基础。
  • 研究LIME的解释在简单、可解释的模型(如线性或乘法函数)下是否具有数学上的合理性。
  • 确定LIME是否能证明忽略黑箱模型未使用的特征。
  • 识别LIME产生误导性或虚假解释的情形。
  • 通过揭示现有方法的理论局限性,指导设计更优的可解释性方法。

提出的方法

  • 通过在黑箱模型上进行期望计算,推导出在大样本极限下表格型LIME可解释系数的显式公式。
  • 采用基于高斯核的加权方案,定义待解释实例周围的局部扰动。
  • 应用统计学习理论,计算加权模型输出的期望,利用特征的独立性。
  • 引入归一化常数,并利用其简化线性近似中的系数计算。
  • 在黑箱函数的结构假设下(如线性、稀疏性、乘法结构)分析LIME的行为。
  • 通过实证实验验证理论预测,显示理论结果与观察行为高度一致。

实验结果

研究问题

  • RQ1当黑箱模型为线性时,表格型LIME是否能产生与真实底层函数数学一致的解释?
  • RQ2表格型LIME是否能证明忽略不影响黑箱模型输出的特征?
  • RQ3当黑箱模型为基于划分的回归器(如CART森林)时,LIME的解释会发生什么变化?
  • RQ4算法参数(如带宽ν)如何影响解释的稳定性和准确性?
  • RQ5是否存在黑箱模型的结构假设,使得LIME的行为可被解析表征?

主要发现

  • 对于线性函数,表格型LIME生成的解释与函数的真实系数成比例,证明了其正确性和一致性。
  • 当黑箱函数仅依赖于部分特征时,表格型LIME可证明对无关特征分配零系数,证实了特征无关性检测能力。
  • 对于乘法函数或稀疏依赖函数,在给定假设下,LIME的解释仍与真实函数结构保持一致。
  • 在CART森林等基于划分的模型情况下,LIME在解释中产生伪影,例如为不影响预测的特征分配非零系数。
  • 基于期望计算推导出的理论预测与实证结果高度吻合,验证了分析框架的有效性。
  • 分析表明,加权函数的选择显著影响解释质量,提示非默认权重可能提升某些模型的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。