Skip to main content
QUICK REVIEW

[论文解读] Analyzing Compositionality-Sensitivity of NLI Models

Yixin Nie, Yicheng Wang|arXiv (Cornell University)|Nov 16, 2018
Topic Modeling参考文献 20被引用 8
一句话总结

本文提出了一种组合性敏感性测试设置,用于评估自然语言推理(NLI)模型在词法特征之外的推理能力。通过选择袋装词模型错误预测标签的样本,该方法隔离了组合性理解,并揭示了尽管在标准基准上表现优异,当前最先进模型在组合语义使用上并不一致,其表现因模型架构而异(例如,树形模型优于基于RNN或袋装词模型的模型)。

ABSTRACT

Success in natural language inference (NLI) should require a model to understand both lexical and compositional semantics. However, through adversarial evaluation, we find that several state-of-the-art models with diverse architectures are over-relying on the former and fail to use the latter. Further, this compositionality unawareness is not reflected via standard evaluation on current datasets. We show that removing RNNs in existing models or shuffling input words during training does not induce large performance loss despite the explicit removal of compositional information. Therefore, we propose a compositionality-sensitivity testing setup that analyzes models on natural examples from existing datasets that cannot be solved via lexical features alone (i.e., on which a bag-of-words model gives a high probability to one wrong label), hence revealing the models' actual compositionality awareness. We show that this setup not only highlights the limited compositional ability of current NLI models, but also differentiates model performance based on design, e.g., separating shallow bag-of-words models from deeper, linguistically-grounded tree-based models. Our evaluation setup is an important analysis tool: complementing currently existing adversarial and linguistically driven diagnostic evaluations, and exposing opportunities for future work on evaluating models' compositional understanding.

研究动机与目标

  • 揭示尽管在标准基准上表现优异,当前最先进NLI模型在组合性理解方面仍存在局限。
  • 证明标准评估和现有对抗性设置无法可靠检测模型对词法特征的过度依赖。
  • 开发一种稳健且可泛化的评估方法,利用现有数据集中的自然样本隔离组合性推理。
  • 根据模型架构设计区分性能表现,特别是对句法和组合性结构的敏感性。
  • 通过聚焦组合性语义而非特定语言现象或对抗性扰动,补充现有诊断性评估。

提出的方法

  • 从SNLI和MNLI中识别出袋装词模型对错误标签赋予高概率的样本,表明正确分类需要组合性结构。
  • 将这些样本用作组合性敏感性(CS)评估集,以测试模型利用组合性语义的能力。
  • 通过修改模型架构(例如,用全连接层替换RNN)和数据增强(打乱输入词序)训练并评估模型,以衡量其对组合性的意识。
  • 比较模型在标准基准(SNLI/MNLI)与CS评估集上的表现,以衡量其对组合性结构的敏感性。
  • 使用LMS(词法误导得分)指标筛选出仅靠词法特征即会误导袋装词模型的样本。
  • 应用对抗性评估,表明在某一类组合性扰动上成功并不能推广至其他类型,表明模型对特定模式存在过拟合。

实验结果

研究问题

  • RQ1当前最先进NLI模型在多大程度上依赖词法特征而非组合性语义?
  • RQ2标准评估和现有对抗性设置能否可靠检测模型缺乏组合性理解?
  • RQ3模型架构(如RNN、树形模型、全连接模型)如何影响其对组合性结构的敏感性?
  • RQ4能否利用现有NLI数据集的筛选子集,创建一种稳健且通用的组合性推理评估方法?
  • RQ5在语言诊断数据集上的成功是否与真正的组合性理解相关?还是模型可能利用词法捷径?

主要发现

  • 七种当前最先进NLI模型在标准SNLI和MNLI基准上表现优异,但在组合性敏感性(CS)测试中表现不佳,表明其组合性理解能力差。
  • 即使使用移除RNN的模型或词序打乱的训练数据,模型在标准基准上仍保持高性能,证明标准评估无法检测组合性能力的丧失。
  • 袋装词模型类模型在CS测试中的表现显著低于序列模型或树形模型,表明模型架构与组合性敏感性密切相关。
  • CS评估设置能有效根据模型处理组合性语义的能力进行区分,其中树形模型优于基于RNN和全连接的模型。
  • 对抗性评估范围有限且无法泛化:在某一类对抗性样本上成功,并不意味着对其他组合性扰动具有鲁棒性。
  • LMS得分能有效识别出仅靠词法特征即会误导袋装词模型的样本,从而实现对组合性推理的针对性测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。