[论文解读] Framework for Evaluating Faithfulness of Local Explanations
本文提出一个框架,通过两种定量度量——一致性与充分性——来评估机器学习中局部解释方法的忠实度。该框架为黑箱解释器提供了估计器和样本复杂度边界,证明忠实度依赖于数据分布,且离散化能显著提升忠实度度量,尤其对SHAP和LIME等方法效果明显。
We study the faithfulness of an explanation system to the underlying prediction model. We show that this can be captured by two properties, consistency and sufficiency, and introduce quantitative measures of the extent to which these hold. Interestingly, these measures depend on the test-time data distribution. For a variety of existing explanation systems, such as anchors, we analytically study these quantities. We also provide estimators and sample complexity bounds for empirically determining the faithfulness of black-box explanation systems. Finally, we experimentally validate the new properties and estimators.
研究动机与目标
- 正式化并量化局部解释系统对其底层预测模型的忠实度。
- 解决现有解释方法可能无法准确反映模型行为的问题,尤其是在分布偏移情况下。
- 为黑箱解释系统中的忠实度评估开发实用的估计器和样本复杂度边界。
- 证明忠实度具有数据依赖性,并可通过对解释输出进行策略性离散化来提升。
提出的方法
- 引入两个核心度量:一致性(相同解释意味着相同预测)与充分性(即使解释不同,相同解释仍意味着相同预测)。
- 定义一致性和充分性的全局与局部变体,基于未标记测试数据构建估计器。
- 推导估计全局忠实度的样本复杂度边界,表明$O(\mathtt{range}(e))$个样本足以实现恒定误差。
- 提出对解释输出(如SHAP值)进行离散化,以提升忠实度度量,尤其在解释过于精细时效果显著。
- 在多种数据集上对多种解释器(Anchors、LIME、SHAP、k-NN、反事实)进行实证评估,以验证度量的有效性。
- 应用统计估计器在真实世界数据上评估忠实度,并通过合成数据与真实数据划分进行验证。
实验结果
研究问题
- RQ1如何对局部解释系统的忠实度进行形式化和定量测量?
- RQ2现有解释方法(如LIME、SHAP、Anchors)在多大程度上满足一致性和充分性?
- RQ3解释系统的忠实度在不同数据分布下如何变化?
- RQ4是否可以对黑箱解释系统可靠地估计忠实度?所需的样本复杂度是多少?
- RQ5解释离散化在提升忠实度度量方面发挥什么作用?
主要发现
- 分析表明,SHAP表现出完美一致性,而LIME则不具备,这与框架中的理论分析一致。
- 对SHAP值进行离散化可显著提升一致性和充分性得分——例如,在Adult数据集上,1-FP离散化下一致性达到0.95,而未离散化时仅为0.02。
- 忠实度高度依赖于数据:在Adult数据集的一个群体中,Anchors的一致性达到0.934,而在另一群体中SHAP得分为0.885。
- 若不进行解释压缩(如离散化),忠实度验证在根本上不可行,如命题2所示。
- 唯一解释数量强烈影响忠实度——唯一性越高,忠实度越低,表明需要进行压缩。
- 全局忠实度估计的样本复杂度为$O(\mathtt{range}(e))$,使得在中等规模未标记数据上可高效进行经验评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。