Skip to main content
QUICK REVIEW

[论文解读] Latent SHAP: Toward Practical Human-Interpretable Explanations

Ron Bitton, Alon Malach|arXiv (Cornell University)|Nov 27, 2022
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

潜在 SHAP 提出了一种模型无关的框架,可在无需从输入特征到可解释概念的完全可逆变换的情况下,为复杂模型生成局部忠实且人类可理解的解释。通过利用人类可理解的特征潜在空间,并在该空间中近似计算 Shapley 值,即使在直接可逆性不可行的情况下,也能实现直观的高层次解释,其在名人吸引力分类任务中的可解释性表现优于标准 SHAP。

ABSTRACT

Model agnostic feature attribution algorithms (such as SHAP and LIME) are ubiquitous techniques for explaining the decisions of complex classification models, such as deep neural networks. However, since complex classification models produce superior performance when trained on low-level (or encoded) features, in many cases, the explanations generated by these algorithms are neither interpretable nor usable by humans. Methods proposed in recent studies that support the generation of human-interpretable explanations are impractical, because they require a fully invertible transformation function that maps the model's input features to the human-interpretable features. In this work, we introduce Latent SHAP, a black-box feature attribution framework that provides human-interpretable explanations, without the requirement for a fully invertible transformation function. We demonstrate Latent SHAP's effectiveness using (1) a controlled experiment where invertible transformation functions are available, which enables robust quantitative evaluation of our method, and (2) celebrity attractiveness classification (using the CelebA dataset) where invertible transformation functions are not available, which enables thorough qualitative evaluation of our method.

研究动机与目标

  • 为解决现有模型无关解释方法(如 SHAP 和 LIME)的局限性,这些方法以低层次或编码的输入特征生成解释,而这些特征对人类难以理解。
  • 开发一种框架,以高层级、人类可理解的特征(例如“微笑”、“戴耳环”)生成解释,而无需从输入特征到这些概念的完全可逆映射。
  • 在现实场景中,当可逆变换不切实际时,确保解释对原始模型行为的忠实性,同时提升可解释性。
  • 在名人吸引力分类任务上,通过可逆变换进行定量评估,并在非可逆设置下进行定性评估。

提出的方法

  • 该框架以黑箱方式运行,使用预训练模型和一个独立的人类可理解的特征提取器,将输入映射到高层概念的潜在空间。
  • 它应用 SHAP 算法的一种变体,在可解释的潜在空间中计算特征归因,通过背景数据集高效近似计算 Shapley 值。
  • 该方法不要求从原始输入到可解释特征的变换是可逆的,因此可在映射模糊或不可行的场景中使用。
  • 它使用一个背景数据集来估计每个可解释特征的期望贡献,通过扰动近似实现局部解释。
  • 该方法支持局部和全局解释生成,特征重要性得分按样本可视化,并在数据集上聚合。
  • 通过定义一组解耦的、人类可读的特征(例如“拱形眉毛”、“高颧骨”),实现基于概念的解释,这些特征源自输入图像。

实验结果

研究问题

  • RQ1当从输入特征到可解释特征的变换不可逆时,潜在 SHAP 是否能生成既局部忠实又直观的人类可理解解释?
  • RQ2在真实世界图像分类任务中,潜在 SHAP 的解释在可解释性和意义性方面与标准 SHAP 相比如何?
  • RQ3潜在 SHAP 的全局特征归因在多大程度上与人类可解释特征和模型预测之间的真实相关性一致?
  • RQ4用于近似的背景数据集大小对解释结果的敏感性如何?

主要发现

  • 在可逆变换的受控实验中,潜在 SHAP 的解释在定性上比标准 SHAP 更具直观性,使用户能更轻松地识别出“微笑”和“戴耳环”等高层特征。
  • 在 CelebA 数据集上,潜在 SHAP 生成的解释能清晰区分有吸引力和无吸引力的面部,对有吸引力的面孔赋予少数关键特征(如“微笑”)较高的正向重要性,而对无吸引力面孔则赋予许多特征较低或负向重要性。
  • 潜在 SHAP 的全局特征归因与真实相关性高度一致:例如,“浓妆”在高值时表现出高正向贡献,低值时则贡献低,反映了其与吸引力的已知相关性。
  • 男性特征(与吸引力呈负相关)被潜在 SHAP 正确分配了负向归因,证实了其对模型行为的忠实性。
  • 背景数据集大小显著影响特征重要性:例如,当背景样本从 50 增加到 150 时,“高颧骨”的重要性从第 7 位(重要性 = -0.04)下降至前 9 名之外。
  • 潜在 SHAP 在不可逆设置下表现出鲁棒性和可解释性,而传统 SHAP 因像素级解释缺乏语义意义而失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。