Skip to main content
QUICK REVIEW

[论文解读] Supervising Model Attention with Human Explanations for Robust Natural Language Inference

Joe Stacey, Yonatan Belinkov|arXiv (Cornell University)|Apr 16, 2021
Topic Modeling被引用 7
一句话总结

本文提出一种方法,通过使用 e-SNLI 数据集中的真人生成解释来监督注意力机制,以提升自然语言蕴涵(NLI)模型的鲁棒性。通过促使模型更关注解释中标记出的词语——尤其是名词和动词等内容词——该方法在 SNLI 上实现了最先进性能,并在分布外数据集上表现出更强的泛化能力,同时使注意力更具可解释性,减少对停用词和标点符号的偏见。

ABSTRACT

Natural Language Inference (NLI) models are known to learn from biases and artefacts within their training data, impacting how well they generalise to other unseen datasets. Existing de-biasing approaches focus on preventing the models from learning these biases, which can result in restrictive models and lower performance. We instead investigate teaching the model how a human would approach the NLI task, in order to learn features that will generalise better to previously unseen examples. Using natural language explanations, we supervise the model's attention weights to encourage more attention to be paid to the words present in the explanations, significantly improving model performance. Our experiments show that the in-distribution improvements of this method are also accompanied by out-of-distribution improvements, with the supervised models learning from features that generalise better to other NLI datasets. Analysis of the model indicates that human explanations encourage increased attention on the important words, with more attention paid to words in the premise and less attention paid to punctuation and stop-words.

研究动机与目标

  • 通过教导模型模仿人类推理而非依赖数据集偏差,解决 NLI 模型在分布外数据上泛化能力差的问题。
  • 通过将人类解释作为注意力机制的监督信号,提升模型在分布内与分布外数据上的性能。
  • 通过鼓励模型更多关注前提中的词语、更少关注停用词和标点符号,减少仅基于假设的偏差。
  • 生成更可解释的注意力模式,使其与人类识别出的前提-假设对中的关键词语保持一致。

提出的方法

  • 引入对比损失项,监督 DeBERTa 的自注意力层中 [CLS] 标记的注意力权重,促使模型对解释中出现的词语给予更高注意力。
  • 对最顶层的自注意力层施加监督,使用独立训练的注意力机制使其与解释相关词语对齐。
  • 采用 Pruthi 等人(2020)提出的方法,该方法利用基于注意力的解释融合,并在 NLI 设置中测试其有效性。
  • 利用 e-SNLI 数据集的自由文本解释,识别每个前提-假设对中的关键词语,形成注意力监督信号。
  • 通过结合 NLI 分类损失与基于解释的注意力正则化进行模型训练,使用多个注意力头进行消融实验。
  • 通过词性标注和词频分析评估注意力分布的变化,以评估注意力向内容词转移、远离功能词的趋势。

实验结果

研究问题

  • RQ1通过人类解释监督模型注意力,能否同时提升 NLI 在分布内与分布外数据上的性能?
  • RQ2基于人类解释的注意力监督是否能带来更具可解释性、更符合人类认知的注意力模式?
  • RQ3当模型被训练为关注解释相关词语时,注意力分布如何变化,特别是在词性标签方面?
  • RQ4注意力监督能否减少标准 NLI 模型中常见的仅基于假设的偏差?
  • RQ5即使仅使用较少的受监督注意力头,是否仍能获得显著性能提升?这又对注意力在不同层之间的迁移有何启示?

主要发现

  • 在顶层的 12 个注意力头中施加监督,使 [CLS] 标记对前提的注意力从 22.86% 提升至 50.89%,显著改善了泛化能力。
  • 即使仅监督 3 个注意力头,前一层对前提的注意力也上升至 54.8%,表明监督信号可有效传播至低层。
  • 受监督的模型更关注名词(46% 的标记词语)、动词和形容词,同时减少了对标点符号、限定词和停用词的注意力。
  • 当与 DeBERTa 结合时,该模型在 SNLI 基准上取得了新的最先进结果,超越了先前方法。
  • 受监督模型的注意力权重能有效预测人类解释中会出现的词语,其性能与专门用于解释预测的模型相当。
  • 该方法在 SNLI-hard 上也提升了性能,这是一个具有挑战性的分布外数据集,证实了模型对分布偏移具有更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。