Skip to main content
QUICK REVIEW

[论文解读] Do Feature Attribution Methods Correctly Attribute Features?

Yilun Zhou, Serena Booth|arXiv (Cornell University)|Apr 27, 2021
Explainable Artificial Intelligence (XAI)被引用 16
一句话总结

本文提出了一种半自然数据集修改方法,用于生成特征归因的黄金标准,从而实现对显著图、理由模型和注意力机制等方法的系统性评估。研究发现,这些方法经常错误地将重要性归因于非信息性特征,尤其是在文本中选择不相关冠词时,这严重削弱了其在现实世界模型中调试虚假相关性的可靠性。

ABSTRACT

Feature attribution methods are popular in interpretable machine learning. These methods compute the attribution of each input feature to represent its importance, but there is no consensus on the definition of "attribution", leading to many competing methods with little systematic evaluation, complicated in particular by the lack of ground truth attribution. To address this, we propose a dataset modification procedure to induce such ground truth. Using this procedure, we evaluate three common methods: saliency maps, rationales, and attentions. We identify several deficiencies and add new perspectives to the growing body of evidence questioning the correctness and reliability of these methods applied on datasets in the wild. We further discuss possible avenues for remedy and recommend new attribution methods to be tested against ground truth before deployment. The code is available at https://github.com/YilunZhou/feature-attribution-evaluation

研究动机与目标

  • 为解决特征归因方法评估中缺乏黄金标准的问题,从而阻碍对其正确性的可靠评估。
  • 开发一种系统性评估框架,利用半自然数据集,在其中人工引入虚假相关性,以创建已知的归因目标。
  • 测试广泛使用的归因方法(显著图、理由模型、注意力机制)是否能正确识别出仅与标签相关的、被操纵的特征。
  • 揭示诸如理由模型选择非相关词语(如文本中的冠词)等失败模式,这些模式会误导人类解释者。
  • 倡导未来在高风险应用场景中部署前,应对归因方法进行基于黄金标准的验证。

提出的方法

  • 通过系统性地修改自然数据,嵌入已知的人工相关性(例如在图像中添加水印,或在文本中插入相关词语),构建半自然数据集。
  • 在这些修改后的数据集上训练高准确率模型,确保其依赖于引入的特征以实现性能。
  • 对训练好的模型应用三种归因方法:显著图、理由模型(RL 和 CR)、注意力机制。
  • 将黄金标准定义为所有为与标签相关而被有意操纵的特征的并集,并以此作为评估归因方法的基准。
  • 使用不同选择率(%Sel)下的精确率来衡量方法识别出真正相关特征的准确性。
  • 分析失败模式,例如理由模型选择非相关词语(如冠词),并评估训练方法(如REINFORCE)对可靠性的影响。

实验结果

研究问题

  • RQ1在修改后的数据集中,特征归因方法能否正确识别出人工引入的、黄金标准下相关的特征?
  • RQ2显著图、注意力机制和理由模型在多大程度上会错误地将重要性归因于非信息性特征(如文本中的冠词)?
  • RQ3训练方法(如强化学习与监督学习)在多大程度上影响理由选择的忠实度?
  • RQ4在缺乏黄金标准的情况下,当前的代理评估指标是否能充分反映归因真实性的正确程度?
  • RQ5当模型依赖于虚假相关性时,归因方法的失败模式是什么,如何加以缓解?

主要发现

  • 理由模型,尤其是通过强化学习训练的模型,即使这些词语对预测无影响,也经常选择诸如冠词等非相关词语。
  • 在文本中识别相关特征的精确率明显不理想,RL模型在高选择率下的精确率显著低于理论最大值。
  • 显著图和注意力机制也未能一致地仅突出被操纵的特征,对无关的图像或文本噪声表现出敏感性。
  • 研究发现,没有任何一种方法达到令人满意的表现,表明在现实世界部署中存在广泛不可靠性。
  • 结果表明,当前的归因方法可能因突出非信息性特征而误导用户,掩盖了模型的真实推理过程。
  • 作者建议在部署前对新归因方法进行严格的黄金标准评估,以确保其忠实度和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。