[论文解读] Reasoning Over Paragraph Effects in Situations
ROPES 是一个包含 14,322 个问题的阅读理解基准,用于评估模型在新情境下从背景段落中推理因果关系的能力。尽管使用了微调的 RoBERTa-large 模型,最佳模型的 F1 分数仅为 61.6%,远低于人类表现(89.0%),凸显了将文本知识应用于新情境的挑战。
A key component of successfully reading a passage of text is the ability to apply knowledge gained from the passage to a new situation. In order to facilitate progress on this kind of reading, we present ROPES, a challenging benchmark for reading comprehension targeting Reasoning Over Paragraph Effects in Situations. We target expository language describing causes and effects (e.g., "animal pollinators increase efficiency of fertilization in flowers"), as they have clear implications for new situations. A system is presented a background passage containing at least one of these relations, a novel situation that uses this background, and questions that require reasoning about effects of the relationships in the background passage in the context of the situation. We collect background passages from science textbooks and Wikipedia that contain such phenomena, and ask crowd workers to author situations, questions, and answers, resulting in a 14,322 question dataset. We analyze the challenges of this task and evaluate the performance of state-of-the-art reading comprehension models. The best model performs only slightly better than randomly guessing an answer of the correct type, at 61.6% F1, well below the human performance of 89.0%.
研究动机与目标
- 开发一个阅读理解基准,用于测试模型在新情境下对因果关系的推理能力,超越局部事实提取。
- 弥补现有数据集仅关注局部谓词-论元结构、而非将知识应用于新情境的空白。
- 评估最先进模型是否能够将背景段落中的因果理解泛化到现实世界情境中。
- 创建一个多样化、高质量的数据集,涵盖多种推理类型和词汇差异,以挑战推理泛化能力。
提出的方法
- 从科学教科书和维基百科中收集背景段落,重点关注涉及原因和结果的因果关系。
- 众包工作者基于这些段落生成新颖的情境、问题和答案,确保与因果关系一致。
- 问题被分为四种推理类型:结果比较、原因比较、结果预测和原因预测。
- 通过分离训练集和测试集的标注者,将数据集划分为训练集和测试集,以减少标注偏差。
- 基线模型在 ROPES 上使用 RoBERTa 进行微调,并额外通过 RACE 预训练进行性能提升实验。
- 对随机抽取的 400 个问题进行了人工评估,以建立性能基准。
实验结果
研究问题
- RQ1阅读理解模型能否将背景段落中的因果知识应用于新情境下的结果推理?
- RQ2背景段落、情境和问题之间存在的词汇差异和改写如何影响模型性能?
- RQ3当前模型在何种推理类型——比较、预测或基础推理——上表现最差?
- RQ4富有经验的标注者产生的标注偏差在多大程度上影响了模型在此基准上的泛化能力?
主要发现
- 表现最佳的模型(使用 RACE 预训练的 RoBERTa-large)在测试集上的 F1 分数为 61.6%,在双选题中仅略高于随机猜测。
- 人类在相同测试集上的 F1 分数达到 89.0%,表明当前模型与人类在推理泛化能力方面存在显著差距。
- 大多数问题涉及结果或原因比较,需要将两个不同的原因或结果实例进行关联,因此特别具有挑战性。
- 当背景段落被移除时,性能显著下降,证实背景知识对准确推理至关重要。
- 该数据集展现出多样的推理类型和词汇变化,其中 8% 的样本涉及非显性的推理或常识推理。
- 模型在词汇差异和改写方面表现不佳,表明需要更强的语义泛化能力,而不仅依赖表面匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。