Skip to main content
QUICK REVIEW

[论文解读] Improving Generalization by Incorporating Coverage in Natural Language Inference

Nafise Sadat Moosavi, Prasetya Ajie Utama|TUbilio (Technical University of Darmstadt)|Sep 19, 2019
Topic Modeling参考文献 25被引用 4
一句话总结

本文通过引入覆盖向量来增强自然语言蕴涵(NLI)神经网络的输入,这些覆盖向量用于衡量假设中的每个词或二元组在前提中被匹配的程度。通过在不使用外部数据的情况下将这些覆盖表示整合到模型输入中,该方法显著提升了在多个NLI数据集上的泛化能力——性能最高提升达30个百分点——并在阅读理解与QA-SRL等相关任务上也增强了迁移性能。

ABSTRACT

The task of natural language inference (NLI) is to identify the relation between the given premise and hypothesis. While recent NLI models achieve very high performance on individual datasets, they fail to generalize across similar datasets. This indicates that they are solving NLI datasets instead of the task itself. In order to improve generalization, we propose to extend the input representations with an abstract view of the relation between the hypothesis and the premise, i.e., how well the individual words, or word n-grams, of the hypothesis are covered by the premise. Our experiments show that the use of this information considerably improves generalization across different NLI datasets without requiring any external knowledge or additional data. Finally, we show that using the coverage information is not only beneficial for improving the performance across different datasets of the same task. The resulting generalization improves the performance across datasets that belong to similar but not the same tasks.

研究动机与目标

  • 解决NLI模型在不同相似数据集上泛化能力差的问题,尽管其在单个基准测试上表现优异。
  • 指出当前模型过度依赖词汇形式,未能学习到抽象的推理知识。
  • 提出一种仅利用内在现有数据特征的方法以改善泛化能力,具体为利用前提对假设中词汇和n-gram的覆盖程度。
  • 评估该方法在阅读理解与QA-SRL等相关NLP任务上的可迁移性。
  • 证明覆盖信息可提升模型在多样化但相似的NLP任务中的鲁棒性与性能,且无需依赖外部知识或额外数据。

提出的方法

  • 计算假设与前提表示之间的相似度矩阵 S = Φ(H)Φ(P)ᵀ,其中 Φ 表示词级嵌入或隐藏层输出。
  • 推导覆盖值 ci = maxj(Sij),即每个假设词与任意前提词的最大相似度,表示其被覆盖的程度。
  • 通过感受野大小为2的卷积神经网络(CNN)将覆盖扩展至二元组,计算表示 Φ′(H),并计算 c′i 为每个二元组与前提二元组的最大相似度。
  • 将覆盖向量 C(用于词)和 C′(用于二元组)以及覆盖位置 Q 和 Q′ 作为额外输入特征引入模型。
  • 通过在领域内开发集上进行超参数搜索,调整 C、C′、Q、Q′ 及表示层 Φ 的使用方式。
  • 使用标准NLI和QA架构,端到端训练带有增强输入的模型,并在域外测试集上进行评估。

实验结果

研究问题

  • RQ1基于覆盖的表示是否能在不使用外部知识或数据的情况下,提升在不同NLI数据集上的泛化能力?
  • RQ2在任务形式多样的情况下,引入词与n-gram覆盖是否能提升模型在域外NLI数据集上的性能?
  • RQ3覆盖信息是否能提升在阅读理解与QA-SRL等相关但不同的NLP任务上的泛化能力?
  • RQ4覆盖向量与位置如何帮助检测存在词汇匹配但语义对齐失败的非蕴涵情形?
  • RQ5在中性对具有高词汇相似性的数据集(如SICK)上,使用覆盖是否能提升性能,尤其是在SNLI/MultiNLI上训练的模型在SICK上表现不佳的情况下?

主要发现

  • 引入覆盖向量可使NLI数据集间的泛化能力提升最高达30个百分点的准确率,且在SNLI、MultiNLI和Glockner数据集上均表现出一致的增益。
  • 在SNLI或MultiNLI上训练的模型,当使用覆盖信息时,在SICK数据集上的表现显著提升,尤其在识别具有高词汇重叠的中性对方面。
  • 覆盖信息可提升在域外QA任务上的性能:当在SQuAD上使用覆盖特征进行训练时,QA-SRL测试集上的EM和F1分数均有所提高。
  • 二元组覆盖(C′)对MQAN模型有益,而仅词级覆盖(C)提升了BIDAF模型的性能,表明不同模型对表示类型存在特定敏感性。
  • 覆盖位置(Q, Q′)有助于检测覆盖词或短语顺序错位的情况,例如在H3中,假设为中性但所有词语均被覆盖但顺序错误。
  • 该方法在不依赖额外数据或外部知识的前提下,提升了多种任务的性能,证明其作为NLP模型的一种简单、通用的归纳偏置具有显著有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。