Skip to main content
QUICK REVIEW

[论文解读] Evaluations and Methods for Explanation through Robustness Analysis

Cheng-Yu Hsieh, Chih‐Kuan Yeh|arXiv (Cornell University)|May 31, 2020
Adversarial Robustness in Machine Learning参考文献 37被引用 15
一句话总结

本文提出了一种基于小对抗扰动而非特征移除或采样的新型特征解释评估框架,减少了解释质量评估中的偏差。通过优化对这类扰动的鲁棒性,该方法能够识别出相关的正向和负向特征,在图像和文本数据集上的用户研究与定量基准测试中均表现出更优性能。

ABSTRACT

Feature based explanations, that provide importance of each feature towards the model prediction, is arguably one of the most intuitive ways to explain a model. In this paper, we establish a novel set of evaluation criteria for such feature based explanations by robustness analysis. In contrast to existing evaluations which require us to specify some way to "remove" features that could inevitably introduces biases and artifacts, we make use of the subtler notion of smaller adversarial perturbations. By optimizing towards our proposed evaluation criteria, we obtain new explanations that are loosely necessary and sufficient for a prediction. We further extend the explanation to extract the set of features that would move the current prediction to a target class by adopting targeted adversarial attack for the robustness analysis. Through experiments across multiple domains and a user study, we validate the usefulness of our evaluation criteria and our derived explanations.

研究动机与目标

  • 解决现有基于特征移除或采样方法在评估特征解释时固有的偏差问题。
  • 提出一种基于鲁棒性的评估标准,利用小对抗扰动更客观地评估特征重要性。
  • 设计一种针对该新鲁棒性标准进行优化的解释方法,以识别出相关的正向和负向特征。
  • 通过定量指标和用户研究验证所提评估与解释方法的有效性。
  • 展示该方法在识别图像与文本分类任务中显著特征方面的优越性。

提出的方法

  • 提出一种基于对抗鲁棒性的新评估标准:通过测量当相关特征受到对抗扰动时预测结果的变化程度来评估。
  • 通过在显著特征上施加对抗扰动来定义必要性(应引起预测的大幅变化),并通过在非显著特征上施加扰动来定义充分性(应无变化)。
  • 使用对抗攻击(如PGD)作为鲁棒性评估的紧致上界,避免NP难的精确计算。
  • 开发了一种基于博弈论的解释算法Greedy-AS,通过迭代选择特征以最大化鲁棒性得分。
  • 通过使用目标对抗攻击,将方法扩展至目标解释任务,以识别能将预测结果引导至目标类别的特征。
  • 将方法应用于图像(MNIST、ImageNet)和文本(Yahoo!Answers)数据集,并与Grad、IG、SHAP、LOO、EG、Anchor和CFX进行比较。

实验结果

研究问题

  • RQ1与基于特征移除或采样的方法相比,对抗鲁棒性能否作为更可靠且偏差更小的特征解释评估标准?
  • RQ2针对对抗鲁棒性进行优化的解释方法能否有效识别出相关的正向和负向特征?
  • RQ3在用户感知的相关性与定量指标方面,所提方法与现有解释方法相比表现如何?
  • RQ4基于鲁棒性的评估能否指导生成更准确且可解释的解释?
  • RQ5该方法是否能在不同模态的数据(如图像与文本)上实现良好泛化?

主要发现

  • 在用户研究中,Greedy-AS在precision@5(0.68)和mAP(0.76)上均达到最高,优于Grad、IG、SHAP、LOO、EG、Anchor和CFX在人工标注真实标签上的表现。
  • 在Yahoo!Answers数据集上,所提出的鲁棒性评估指标(Robustness- $\bar{S}_r$)的AUC达到2.13,优于所有基线方法,包括CFX和EG。
  • 在MNIST上,Greedy-AS在选择前20%特征时的运行时间为13.621秒,显著快于SHAP(9.673秒)和CFX(8.582秒),但慢于Grad(0.005秒)。
  • 该方法成功识别出相关的正向和负向特征,如图1所示:扰动蓝色区域(正向)或绿色/黄色区域(负向)会改变数字预测结果。
  • 在删除与插入评估中,Robustness- $S_r$ 值越低表示解释越好,Greedy-AS达到最低值(7.64),表明其充分性表现极强。
  • 用户研究结果表明,Anchor和IG选出的top-1关键词与人类直觉最吻合,但Greedy-AS在k=1至5的总体精确度最高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。