Skip to main content
QUICK REVIEW

[论文解读] Saliency Learning: Teaching the Model Where to Pay Attention

Reza Ghaeini, Xiaoli Z. Fern|arXiv (Cornell University)|Feb 22, 2019
Explainable Artificial Intelligence (XAI)参考文献 20被引用 12
一句话总结

本文提出显著性学习(saliency learning),一种通过梯度显著性正则化将真实解释标注整合到损失函数中的方法,以训练深度神经网络关注相关输入特征。该方法通过使模型注意力与期望的证据对齐,提升了模型的可靠性与性能,相比标准训练,显著提高了F1分数、准确率和显著性对齐程度。

ABSTRACT

Deep learning has emerged as a compelling solution to many NLP tasks with remarkable performances. However, due to their opacity, such models are hard to interpret and trust. Recent work on explaining deep models has introduced approaches to provide insights toward the model's behaviour and predictions, which are helpful for assessing the reliability of the model's predictions. However, such methods do not improve the model's reliability. In this paper, we aim to teach the model to make the right prediction for the right reason by providing explanation training and ensuring the alignment of the model's explanation with the ground truth explanation. Our experimental results on multiple tasks and datasets demonstrate the effectiveness of the proposed method, which produces more reliable predictions while delivering better results compared to traditionally trained models.

研究动机与目标

  • 解决深度学习模型依赖数据中的虚假统计偏差而非有意义证据的问题。
  • 通过确保预测基于正确原因,提升模型的可解释性与可靠性。
  • 开发一种训练方法,使模型注意力(通过显著性)与真实解释标注对齐。
  • 验证显著性训练模型是否对关键标注输入部分的扰动更加敏感。
  • 在多个NLP任务和数据集上验证显著性学习的有效性。

提出的方法

  • 该方法在模型损失函数中引入显著性正则化项,使用合页损失(hinge loss)惩罚预测显著性与真实解释掩码之间的错位。
  • 显著性通过模型输出对输入嵌入的梯度计算得出,对每个词的所有嵌入维度梯度进行聚合。
  • 对于每个词,若真实解释掩码Z[i] = 1,则鼓励模型具有正的梯度贡献;否则,若梯度为正则施加惩罚。
  • 正则化项定义为λ × Σ max(0, -Z[i] × Σ_j ∂f_θ(X,y)/∂X_{i,j})(对所有词i),其中λ控制正则化强度。
  • 该方法将基于梯度的显著性正则化扩展至深层网络的中间层,而不仅限于输入层,从而提升对齐度与性能。
  • 该方法使用模拟解释(如事件的触发词)来训练模型关注文本中语义相关的部分。

实验结果

研究问题

  • RQ1在训练过程中整合解释标注是否能提升模型的可靠性与性能?
  • RQ2显著性学习是否能实现模型注意力与期望解释线索之间的更好对齐?
  • RQ3显著性训练模型是否对正样本中关键标注词的移除更加敏感?
  • RQ4在F1、准确率与显著性准确率方面,显著性学习与标准训练相比表现如何?
  • RQ5将显著性正则化扩展至网络中间层是否相比仅输入层正则化能提升性能?

主要发现

  • 在ACE、ERE、CBT-NE和CBT-CN数据集上,显著性训练模型相比基线模型显著提高了F1分数与准确率。
  • 在ACE数据集上,移除贡献性词语后,显著性训练模型的真正率(TPR)降低了32.6%,而基线模型降低了40.9%,证实了其对关键输入部分的更高敏感性。
  • 显著性训练模型在显著性对齐方面表现更优,如表3中对最显著词语的可视化所示。
  • 该方法在所有评估数据集上均提升了精确率、F1与准确率,其中在CBT-NE与CBT-CN上提升最为显著。
  • 验证实验确认,显著性训练模型对标注贡献性词语的扰动更加敏感,表明其与期望注意力机制的对齐性更强。
  • 该方法优于标准训练与先前的基于梯度的正则化方法,因其聚焦于正向证据,而非无关或负向标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。