Skip to main content
QUICK REVIEW

[论文解读] Evaluating Saliency Methods for Neural Language Models

Shuoyang Ding, Philipp Koehn|arXiv (Cornell University)|Apr 12, 2021
Explainable Artificial Intelligence (XAI)参考文献 47被引用 6
一句话总结

本文提出了一项定量基准,用于通过两个核心标准——合理性(与人类直觉的一致性)和忠实性(在输入扰动下的稳定性)——评估神经网络语言模型中的显著性方法。研究发现,显著性解释通常不可靠,其性能对模型架构和配置高度敏感,呼吁研究人员在使用前验证解释结果。

ABSTRACT

Saliency methods are widely used to interpret neural network predictions, but different variants of saliency methods often disagree even on the interpretations of the same prediction made by the same model. In these cases, how do we identify when are these interpretations trustworthy enough to be used in analyses? To address this question, we conduct a comprehensive and quantitative evaluation of saliency methods on a fundamental category of NLP models: neural language models. We evaluate the quality of prediction interpretations from two perspectives that each represents a desirable property of these interpretations: plausibility and faithfulness. Our evaluation is conducted on four different datasets constructed from the existing human annotation of syntactic and semantic agreements, on both sentence-level and document-level. Through our evaluation, we identified various ways saliency methods could yield interpretations of low quality. We recommend that future work deploying such methods to neural language models should carefully validate their interpretations before drawing insights.

研究动机与目标

  • 解决神经网络语言模型中显著性方法缺乏定量评估的问题。
  • 通过测量合理性与忠实性,评估显著性解释是否可信。
  • 利用人工标注的语言学数据构建基准,实现系统的评估。
  • 识别显著性方法产生可靠解释的条件。
  • 建议在得出关于模型行为结论前,对显著性解释进行严格验证。

提出的方法

  • 本研究在基于Transformer的语言模型上评估了显著性方法——原始梯度、SmoothGrad和积分梯度。
  • 通过在嵌入维度上使用L2范数组合梯度值,生成词级别的重要性分数。
  • 通过将显著性分数与句法和语义一致任务中人工标注的提示词/吸引词进行比较,测试合理性。
  • 通过扰动输入特征并测量在预测结果保持不变时显著性分数的一致性,评估忠实性。
  • 从现有语言学标注中构建了四个测试集,涵盖句子级和文档级任务。
  • 在三种模型架构及多种配置下应用评估,以检验其敏感性。

实验结果

研究问题

  • RQ1显著性方法在句法和语义一致任务中,与人工标注的语言学提示词的对齐程度如何?
  • RQ2在保持模型预测不变的输入扰动下,显著性解释在多大程度上保持一致?
  • RQ3模型架构或配置如何影响显著性解释的可靠性?
  • RQ4合理性与忠实性能否作为评估显著性方法可信度的可靠指标?
  • RQ5在何种条件下,显著性方法可被视为可靠以解释神经网络语言模型的决策?

主要发现

  • 显著性方法常产生缺乏合理性的解释,在语言一致任务中未能与人工标注的提示词对齐。
  • 解释在忠实性测试中也频繁失败,表现出在保持预测不变的扰动下分数不一致。
  • 显著性解释的可靠性对模型架构和超参数配置高度敏感。
  • 没有任何一种显著性方法在所有测试集中始终优于其他方法,表明不存在普遍可靠的显著性方法。
  • 即使最先进的模型在未使用合理性与忠实性标准进行验证时,其解释质量也表现不佳。
  • 本研究证明,未经验证的显著性解释可能导致对模型推理过程的误导性结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。