[论文解读] Rethinking Stability for Attribution-based Explanations
本文引入相对稳定性度量以评估基于归因的解释方法,通过测量解释在模型输入、表示或输出扰动下的变化程度。实验表明,在三个真实世界数据集上,SmoothGrad在七种方法中表现出最高的稳定性,平均比其他方法高出12.7%。
As attribution-based explanation methods are increasingly used to establish model trustworthiness in high-stakes situations, it is critical to ensure that these explanations are stable, e.g., robust to infinitesimal perturbations to an input. However, previous works have shown that state-of-the-art explanation methods generate unstable explanations. Here, we introduce metrics to quantify the stability of an explanation and show that several popular explanation methods are unstable. In particular, we propose new Relative Stability metrics that measure the change in output explanation with respect to change in input, model representation, or output of the underlying predictor. Finally, our experimental evaluation with three real-world datasets demonstrates interesting insights for seven explanation methods and different stability metrics.
研究动机与目标
- 为解决高风险机器学习应用中基于归因的解释方法的不稳定性问题,即微小输入变化导致解释结果大幅波动。
- 克服以往稳定性度量仅考虑输入扰动而忽略模型内部机制的局限性。
- 提出并验证新的稳定性度量——相对输入稳定性(RIS)、相对表示稳定性(RRS)和相对输出稳定性(ROS),以整合模型行为信息。
- 通过多个数据集和预测模型,对七种最先进解释方法的稳定性进行实证比较。
- 建立理论边界,将解释不稳定性与模型的利普希茨常数及表示稳定性联系起来。
提出的方法
- 提出相对稳定性度量:相对输入稳定性(RIS)、相对表示稳定性(RRS)和相对输出稳定性(ROS),分别衡量解释在输入、表示或输出扰动下的变化程度。
- 基于模型的输入到隐藏层利普希茨常数与RRS的乘积,推导出RIS的理论上限,建立模型特性与解释稳定性之间的正式联系。
- 通过为每个测试样本生成50个无穷小扰动,实证评估稳定性,并计算七种解释方法的解释变化。
- 采用逻辑回归和人工神经网络作为预测模型,通过VanillaGrad、Integrated Gradients、SmoothGrad、Input×Gradients、LIME、SHAP以及一个随机基线生成解释。
- 使用原始解释与扰动后解释之间的L2范数差值,并按扰动大小进行归一化,以量化不稳定性。
- 通过将实证RIS值与基于模型架构和表示稳定性推导出的理论上限进行比较,验证理论边界。
实验结果
研究问题
- RQ1现有稳定性度量为何无法捕捉模型层面的行为,特别是在内部表示方面?
- RQ2基于归因的解释方法在无穷小的输入、表示或输出扰动下,其稳定性如何?
- RQ3能否推导出将解释不稳定性与模型特定属性(如利普希茨常数)关联的理论边界?
- RQ4哪种解释方法在多种稳定性变体和数据集中表现出最稳健的性能?
- RQ5稳定性度量在对输入、表示或输出变化的敏感性上如何不同?它们揭示了关于解释可靠性哪些新见解?
主要发现
- 相对输入稳定性(RIS)得分始终低于RRS和ROS,表明输入扰动对解释差异具有更强的归一化作用。
- RIS的理论上限在实证中得到验证,且边界较紧,所有方法的平均理论上限比实证值高出233%。
- SmoothGrad在所有数据集和稳定性变体中均表现出最高稳定性,其平均不稳定性比其他方法低12.7%。
- 表示和输出稳定性度量(RRS和ROS)表明,模型内部结构显著影响解释稳定性,凸显了在评估中需超越输入扰动、考虑模型行为的必要性。
- 没有一种解释方法是完全稳定的,但SmoothGrad在多个数据集(Adult、Compas、German Credit)和预测模型(LR和ANN)中均表现出最一致的鲁棒性。
- 理论分析证实,解释不稳定性受模型输入到隐藏层利普希茨常数与表示稳定性乘积的限制,为稳定性评估提供了正式理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。