Skip to main content
QUICK REVIEW

[论文解读] Interpreting Recurrent and Attention-Based Neural Models: a Case Study on Natural Language Inference

Reza Ghaeini, Xiaoli Z. Fern|arXiv (Cornell University)|Aug 12, 2018
Explainable Artificial Intelligence (XAI)参考文献 17被引用 10
一句话总结

本文通过可视化注意力和LSTM门控信号的显著性,提出了一种新颖的循环神经网络与基于注意力的神经模型在自然语言蕴涵任务中的解释框架。通过分析模型决策相对于这些中间信号的梯度,该方法揭示了传统注意力可视化无法暴露的关键语言线索——如词对齐和信息流模式,表明模型深层行为可超越表面注意力图进行解释。

ABSTRACT

Deep learning models have achieved remarkable success in natural language inference (NLI) tasks. While these models are widely explored, they are hard to interpret and it is often unclear how and why they actually work. In this paper, we take a step toward explaining such deep learning based models through a case study on a popular neural model for NLI. In particular, we propose to interpret the intermediate layers of NLI models by visualizing the saliency of attention and LSTM gating signals. We present several examples for which our methods are able to reveal interesting insights and identify the critical information contributing to the model decisions.

研究动机与目标

  • 为解决自然语言蕴涵(NLI)任务中深度神经网络模型决策过程不透明的问题,尽管其性能优异。
  • 探究中间组件——特别是注意力机制和LSTM门控信号——在复杂NLI任务中对模型预测的贡献。
  • 开发并验证超越词级显著性和注意力热图的新可视化技术,以揭示内部模型动态的功能角色。
  • 证明注意力和门控信号的显著性可揭示标准注意力图中不可见的关键语言差异。
  • 为模型改进和提升NLP系统可信度提供关于模型行为的洞见。

提出的方法

  • 通过计算最终预测得分相对于注意力相似度值的梯度,提出对注意力权重的显著性分析。
  • 通过计算预测得分相对于每个门控信号激活值的偏导数,将显著性分析扩展至LSTM门控信号(输入门、遗忘门、输出门)。
  • 通过L2范数聚合门控信号的显著性和信号值,以降低维度并提升可解释性。
  • 对输入LSTM和推理LSTM层的时间步长,可视化归一化的信号范数和显著性范数,以比较前向与后向读取动态。
  • 在SNLI数据上使用模型变体(ESIM-50 和 ESIM-300)比较不同嵌入维度下的解释效果。
  • 对具有已知黄金标签的具体示例应用可视化,分析模型在蕴含、中性与矛盾情形下的行为。

实验结果

研究问题

  • RQ1显著性模式与标准注意力热图相比,在揭示模型决策过程方面有何不同?
  • RQ2LSTM门控信号显著性在多大程度上突出了驱动模型预测的关键词或短语?
  • RQ3输入LSTM与推理LSTM的显著性模式在关注语言内容方面有何差异?
  • RQ4显著性分析能否检测到标准注意力图中不可见的模型失败或错位现象,例如错误聚焦于非矛盾性词语?
  • RQ5深层模型(如ESIM-300)是否在复杂推理情形下学习到比浅层模型(如ESIM-50)更准确的显著性模式?

主要发现

  • 显著性分析显示,ESIM-300在矛盾案例中正确聚焦于关键词对(如'John'和'man'),而ESIM-50未做到,尽管两者的注意力图相似。
  • 推理LSTM的显著性更集中于关键判别性词语(如矛盾中的'nap'),而输入LSTM则表现出更广泛的显著性,表明其在处理中扮演不同角色。
  • 在中性示例中,'with her family'区域的高显著性解释了为何模型拒绝蕴含关系,因为该短语在前提中未出现。
  • 显著性范数在相同LSTM内的各门控信号间表现出一致模式,表明输入门、遗忘门与输出门具有联合可解释性。
  • 前向与后向LSTM有时聚焦于句子的不同部分,表明其在句子理解中具有互补作用。
  • 仅依赖注意力可视化无法区分不同标签的案例(如蕴含与矛盾),但显著性图清晰揭示了模型关注的差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。