Skip to main content
QUICK REVIEW

[论文解读] ANLIzing the Adversarial Natural Language Inference Dataset

Adina Williams, Tristan Thrush|arXiv (Cornell University)|Oct 24, 2020
Topic Modeling参考文献 55被引用 16
一句话总结

本文提出了一种针对对抗性自然语言蕴含(ANLI)数据集的细粒度、分层标注方案,将三轮中的3,200对句子划分为40种子推理类型。作者利用该方案进行深入的错误分析,揭示了当前最先进模型在哪些推理类型上表现最弱,并提供了一个公开资源,以促进自然语言理解(NLU)中模型评估与开发的改进。

ABSTRACT

We perform an in-depth error analysis of Adversarial NLI (ANLI), a recently introduced large-scale human-and-model-in-the-loop natural language inference dataset collected over multiple rounds. We propose a fine-grained annotation scheme of the different aspects of inference that are responsible for the gold classification labels, and use it to hand-code all three of the ANLI development sets. We use these annotations to answer a variety of interesting questions: which inference types are most common, which models have the highest performance on each reasoning type, and which types are the most challenging for state of-the-art models? We hope that our annotations will enable more fine-grained evaluation of models trained on ANLI, provide us with a deeper understanding of where models fail and succeed, and help us determine how to train better models in future.

研究动机与目标

  • 开发一种与领域无关的分层标注方案,用于分析ANLI数据集中推理类型的特征。
  • 通过按推理类型识别失败模式,对当前最先进模型在ANLI上的表现进行详细错误分析。
  • 揭示哪些推理类型最为常见、最具挑战性,以及模型在何处表现不佳。
  • 提供公开可获取的手动标注数据,以支持更细粒度的评估与未来模型改进。

提出的方法

  • 设计一个包含40种不同推理类型的四层分层标注方案,涵盖逻辑性、事实性及语用性推理模式。
  • 训练并部署一名专家标注员,对ANLI开发集中全部3,200个样本在三轮中进行人工标注。
  • 通过第二名专家在子集上进行标注者间一致性检查,以验证标注的可靠性。
  • 使用多种当前最先进Transformer模型,分析不同推理类型下的模型表现。
  • 将ANLI的语言学与结构特性(如句子长度、词频)与SNLI和MultiNLI进行比较。
  • 利用词频分析与标签分析,识别领域特定模式及标注标签的普遍性。

实验结果

研究问题

  • RQ1ANLI数据集中哪些推理类型最为普遍?
  • RQ2当前最先进NLI模型在哪些推理类型上最具挑战性?
  • RQ3模型表现与失败模式在不同推理类型及数据轮次之间如何变化?
  • RQ4ANLI与先前NLI基准(如SNLI和MultiNLI)在语言学与结构上的关键差异是什么?
  • RQ5标注标签与模型预测错误及模型置信度之间有何关联?

主要发现

  • ANLI数据集的上下文长度显著长于SNLI和MultiNLI,第三轮中上下文平均长度为59.2个词符,而MultiNLI中仅为19.5个。
  • 上下文中最常见的词汇具有领域特异性,如‘film’、‘album’、‘directed’和‘television’,反映出数据源自维基百科。
  • 尽管任务复杂,该标注方案仍实现了较高的标注者间一致性,表明细粒度标签具有高度可靠性。
  • 模型在特定推理类型上表现出持续的性能差距,如序数词、文字游戏和事实性并列,即使在大型Transformer模型中仍具挑战性。
  • 最常见的标注标签包括‘Numerical’、‘Tricky’、‘Reasoning’、‘Plaus.’和‘Syntactic’,表明细微的语言线索与推理是ANLI难度的核心因素。
  • 与SNLI或MultiNLI相比,该数据集的推理理由显著更长,ANLI中平均理由长度为10.3个词符,表明其对更复杂推理依据的要求更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。