[论文解读] Natural Language Inference in Context -- Investigating Contextual Reasoning over Long Texts
本文提出了ConTRoL,一个源自专家设计的警察招募口头推理测试的篇章级自然语言推理数据集,强调复杂的上下文推理,如逻辑推理、多步推理和指代消解推理。尽管最先进的模型如BERT和BART在指代消解推理上的准确率仅达到约75%,但在逻辑推理和多步推理上的表现显著下降,暴露出模型与人类表现之间的巨大差距,凸显了该数据集在上下文推理评估方面的挑战。
Natural language inference (NLI) is a fundamental NLP task, investigating the entailment relationship between two texts. Popular NLI datasets present the task at sentence-level. While adequate for testing semantic representations, they fall short for testing contextual reasoning over long texts, which is a natural part of the human inference process. We introduce ConTRoL, a new dataset for ConTextual Reasoning over Long texts. Consisting of 8,325 expert-designed "context-hypothesis" pairs with gold labels, ConTRoL is a passage-level NLI dataset with a focus on complex contextual reasoning types such as logical reasoning. It is derived from competitive selection and recruitment test (verbal reasoning test) for police recruitment, with expert level quality. Compared with previous NLI benchmarks, the materials in ConTRoL are much more challenging, involving a range of reasoning types. Empirical results show that state-of-the-art language models perform by far worse than educated humans. Our dataset can also serve as a testing-set for downstream tasks like Checking Factual Correctness of Summaries.
研究动机与目标
- 为解决缺乏测试复杂上下文推理(超越句子级蕴涵)的篇章级NLI基准的问题。
- 创建一个高质量、专家标注的数据集,以捕捉逻辑推理、多步推理和分析性推理等推理类型。
- 评估当前最先进语言模型在长篇、富含上下文的文本上进行推理时的局限性。
- 为摘要的事实正确性评估等下游任务提供可靠的基准。
提出的方法
- ConTRoL数据集源自真实的竞争性选拔与招聘测试文本,确保专家级质量与复杂性。
- 每个样本包含一段8至15句话的上下文篇章和一个假设,标注有蕴涵、矛盾或中性关系的黄金标准标签。
- 该数据集强调需要跨句子整合多个事实的推理类型,包括逻辑推导和多步推理。
- 对模型在ConTRoL上进行微调,并在零样本和少样本设置下进行评估,以衡量其泛化能力和迁移能力。
- 通过遮蔽上下文或假设进行消融研究,以检验标注中的伪影和模型偏差。
- 在五类推理类型上对比不同模型(包括BERT、BART和Longformer)的表现。
实验结果
研究问题
- RQ1最先进的NLP模型能否在需要复杂上下文推理的篇章级自然语言推理任务上表现良好?
- RQ2与人类水平表现相比,模型在逻辑推理、多步推理和指代消解推理等推理类型上的表现如何?
- RQ3标注伪影或仅基于假设的偏差在多大程度上影响了模型在ConTRoL数据集上的预测?
- RQ4在ConTRoL上进行微调是否能提升模型在下游推理任务上的表现,相较于从现有NLI基准进行迁移学习?
- RQ5不同模型架构(如BERT、BART、Longformer)在长上下文推理和信息整合方面表现如何?
主要发现
- 最先进的模型如BERT和BART在指代消解推理上的准确率分别为74.64%和74.92%,表明表现较强但未达人类水平。
- 在逻辑推理和多步推理上的表现显著下降,BART的准确率分别仅为48.75%和47.89%,凸显了模型的局限性。
- 人类在ConTRoL上的表现远高于模型,表明上下文推理能力存在巨大差距。
- 消融研究显示,模型需要同时依赖上下文和假设才能做出准确预测,仅使用假设的准确率为36.07%(BERT),表明标注偏差极小。
- 从现有NLI基准(如MultiNLI和SNLI)进行迁移学习的零样本性能较差(例如,BART-NLI为45.0%),表明ConTRoL与先前数据集之间存在分布差异。
- Longformer在上下文仅和假设仅的消融实验中均优于BERT和BART,表明其具备更强的长上下文建模能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。