[论文解读] Knowledge Enhanced Attention for Robust Natural Language Inference
本文提出了一种知识增强型注意力机制,通过将外部词汇知识注入多头注意力层,提升自然语言蕴涵(NLI)任务的鲁棒性。通过在不增加参数的情况下,利用结构化知识嵌入对注意力分数进行变换,该方法在对抗性NLI基准上显著提升性能,在结合BERT时,于对抗性SNLI数据集上实现了人类水平的准确率。
Neural network models have been very successful at achieving high accuracy on natural language inference (NLI) tasks. However, as demonstrated in recent literature, when tested on some simple adversarial examples, most of the models suffer a significant drop in performance. This raises the concern about the robustness of NLI models. In this paper, we propose to make NLI models robust by incorporating external knowledge to the attention mechanism using a simple transformation. We apply the new attention to two popular types of NLI models: one is Transformer encoder, and the other is a decomposable model, and show that our method can significantly improve their robustness. Moreover, when combined with BERT pretraining, our method achieves the human-level performance on the adversarial SNLI data set.
研究动机与目标
- 解决当前SOTA NLI模型在对抗性样本上表现不佳的问题,其性能下降超过20%。
- 克服现有知识融合方法的局限性,这些方法依赖于特定模型架构且需要修改网络结构。
- 开发一种通用、无参数的方法,将外部知识注入各类NLI架构中的注意力机制。
- 证明在推理和训练阶段均注入知识,对于提升鲁棒性至关重要。
- 通过一种简单且可迁移的注意力机制修改,实现在对抗性SNLI基准上达到人类水平性能。
提出的方法
- 提出一种知识增强型注意力机制,通过引入来自外部知识源(如WordNet)的结构化嵌入,修改注意力分数的计算方式。
- 利用外部知识嵌入的可学习投影对原始注意力分数进行变换,使注意力能够关注输入分布之外的语义相关标记。
- 将修改后的注意力层应用于分解注意力模型和基于Transformer的模型(如BERT),无需改变模型架构或增加参数。
- 确保知识注入在训练和推理阶段均发生,以使模型能够学习有效利用外部知识。
- 以预训练模型如BERT和OpenAI GPT作为基础架构,并将其知识增强型注意力机制应用于其多头注意力层。
- 利用词汇知识(如同义词、上下位词和反义词)生成对抗性样本,并改善注意力机制中的对齐效果。
实验结果
研究问题
- RQ1在注意力机制中注入外部词汇知识,能否提升NLI模型在对抗性样本上的鲁棒性?
- RQ2所提出的方法是否能在不同NLI架构(包括分解模型和Transformer)上实现泛化?
- RQ3知识注入带来的性能提升是否依赖于在训练和推理阶段同时应用?
- RQ4当与BERT等预训练模型结合时,该方法能否在对抗性NLI基准上实现人类水平性能?
- RQ5与特定模型的知识融合技术相比,该方法在简洁性、可迁移性和有效性方面表现如何?
主要发现
- 知识增强型注意力机制在SNLI数据集上将对抗性准确率提升了超过20个百分点,其中Model I在对抗性SNLI上的准确率达到84.4%,而无知识注入时仅为63.2%。
- 当与BERT结合时,该方法在对抗性SNLI测试集上达到93.9%的准确率,与Glockner等人(2018)报告的估计人类水平性能一致。
- 在BERT中,该方法显著提升了中性类别召回率(从11%提升至23%)和蕴含样本的精确率(从74%提升至85%),表明泛化能力更强。
- 仅在推理阶段进行事后知识注入无法提升鲁棒性,证明知识必须在训练和推理阶段同时集成才能有效。
- 与标准BERT相比,该方法在对抗性SNLI上实现了3%的准确率提升,表明即使是大型预训练模型也能从知识增强型注意力机制中获益。
- 该方法具有模型无关性和无参数特性,可广泛应用于任何注意力机制模型,且无需修改网络结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。