Skip to main content
QUICK REVIEW

[论文解读] Right for the Right Reasons: Training Differentiable Models by Constraining their Explanations

Andrew Slavin Ross, Michael C. Hughes|arXiv (Cornell University)|Mar 10, 2017
Explainable Artificial Intelligence (XAI)被引用 6
一句话总结

本文提出一种方法,通过约束输入梯度来训练可微分机器学习模型,确保其预测是基于正确的原因。通过应用基于梯度的解释与正则化,该方法在无显式标注的情况下,也能在分布偏移下提升模型泛化能力,并通过迭代优化发现多样且鲁棒的决策边界。

ABSTRACT

Neural networks are among the most accurate supervised learning methods in use today, but their opacity makes them difficult to trust in critical applications, especially when conditions in training differ from those in test. Recent work on explanations for black-box models has produced tools (e.g. LIME) to show the implicit rules behind predictions, which can help us identify when models are right for the wrong reasons. However, these methods do not scale to explaining entire datasets and cannot correct the problems they reveal. We introduce a method for efficiently explaining and regularizing differentiable models by examining and selectively penalizing their input gradients, which provide a normal to the decision boundary. We apply these penalties both based on expert annotation and in an unsupervised fashion that encourages diverse models with qualitatively different decision boundaries for the same classification problem. On multiple datasets, we show our approach generates faithful explanations and models that generalize much better when conditions differ between training and test.

研究动机与目标

  • 解决模型虽达到高准确率但依赖训练数据中的虚假相关性或混淆因素的问题。
  • 开发一种可扩展的方法,利用输入梯度作为忠实且高效的解释,对可微分模型进行解释与正则化。
  • 使模型能够在训练数据与测试数据分布不同时,学习到更具泛化能力的决策边界。
  • 在缺乏专家标注的情况下,提供一种机制以发现多种定性不同的高精度分类器。

提出的方法

  • 该方法使用输入梯度作为模型预测的局部一阶解释,计算效率高且忠实于模型的决策边界。
  • 提出一种可微分的正则化损失,惩罚不良的梯度模式,促使模型依赖有意义的输入特征。
  • 对于带标注的数据,该方法应用专家提供的约束 $ A $ 来引导梯度惩罚,确保模型学习正确的推理过程。
  • 在无标注的情况下,该方法采用迭代的“寻找另一组解释”过程,发现多样且高精度、具有不同决策边界的模型。
  • 该方法将梯度惩罚整合到标准交叉熵损失中,实现端到端训练,计算开销极小。
  • 该方法支持灵活的正则化方式,包括基于范数的惩罚(如 L1)以及对梯度方向或大小的特征特定约束。

实验结果

研究问题

  • RQ1输入梯度能否作为忠实且可扩展的解释,捕捉模型推理过程并指导正则化?
  • RQ2当训练数据与测试数据分布不同时,基于梯度的约束能否提升模型泛化能力?
  • RQ3在无专家标注的情况下,该方法能否发现多种定性不同的高精度分类器?
  • RQ4梯度惩罚如何影响模型决策边界的可解释性与鲁棒性?
  • RQ5该方法能否缓解诸如混淆学习等问题(例如,哮喘被错误预测为降低肺炎再入院风险)?

主要发现

  • 在 Iris 和 Cancer 数据集上,该方法发现了训练准确率较低但测试准确率显著更高的模型,表明其通过避免依赖虚假特征而实现了更好的泛化。
  • 在 Decoy MNIST 上,该方法仅用一次迭代就恢复了基线准确率,展示了从混淆训练数据中快速恢复的能力。
  • 随着迭代进行,梯度模式更加直观且分布更均匀,梯度正确指示出增强笔画特征会提高数字的概率。
  • 在 20 Newsgroups 数据集上,类标签的词关联关系在迭代过程中发生了有意义的演变,同时保持了高训练准确率,表明决策边界具有动态性和多样性。
  • 当梯度惩罚强度($ \lambda_1 $)过高时,模型行为变得不稳定,表明需要仔细调整超参数。
  • 该方法在未明确提示误导性特征的情况下自发发现了更具泛化能力的模型,表明其对数据混淆具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。