[论文解读] TORQUE: A Reading Comprehension Dataset of Temporal Ordering Questions
TORQUE 是一个新型阅读理解数据集,包含 3.2K 条新闻片段和 21K 个由人类标注的问题,旨在评估事件之间的时间顺序。该数据集通过自然语言问题测试模型推断事件序列的能力,RoBERTa-large 在该数据集上的精确匹配得分仅为 51%,比人类表现低 30%,凸显了当前 NLP 系统在时间推理方面存在显著差距。
A critical part of reading is being able to understand the temporal relationships between events described in a passage of text, even when those relationships are not explicitly stated. However, current machine reading comprehension benchmarks have practically no questions that test temporal phenomena, so systems trained on these benchmarks have no capacity to answer questions such as "what happened before/after [some event]?" We introduce TORQUE, a new English reading comprehension benchmark built on 3.2k news snippets with 21k human-generated questions querying temporal relationships. Results show that RoBERTa-large achieves an exact-match score of 51% on the test set of TORQUE, about 30% behind human performance.
研究动机与目标
- 解决现有阅读理解基准中缺乏时间推理评估的问题,这些基准大多集中于指代消解和实体关系。
- 构建一个大规模、基于自然语言问答的数据集,用于测试系统推断事件之间时间顺序的能力,即使关系是隐含的亦可。
- 设计一个可扩展、高质量的众包标注流程,生成包含对比性时间关键词(例如 before/after/during)的问题,以检验模型对细微语言线索的敏感度。
- 提供一个能够捕捉复杂时间现象的基准,如事件持续时间、多事件序列以及超越句子边界的时序范围。
- 通过公开数据集和代码库,为未来研究改进神经网络模型的时间推理能力提供可复现的评估基础。
提出的方法
- 从 TempEval3 数据集收集 3.2K 条新闻片段,聚焦于包含多个事件和时间动态的叙事文本。
- 利用众包工作者根据预定义的事件模式对文本中的事件进行标注,识别谓词及其论元作为事件。
- 使用自然语言生成 21K 个由人类编写的、询问时间关系的问题(例如:'X 之前发生了什么?'),重点关注 before、after、during 等时间关键词。
- 包含对比性问题对(例如将 'before' 替换为 'after'),以测试模型对微小词汇变化的鲁棒性。
- 通过额外的众包工作者验证 20% 的数据,形成测试集,确保标注质量并减少数据收集过程中的偏差。
- 在数据集上微调最先进的模型(如 RoBERTa-large),并使用测试集上的精确匹配准确率进行评估。
实验结果
研究问题
- RQ1当时间关系隐含或需要跨句子推理时,现有阅读理解模型能否准确推断事件之间的时间顺序?
- RQ2当前模型对自然语言问题中时间关键词的细微变化(例如 'before' 与 'after')有多敏感?
- RQ3模型在理解事件持续时间、持续状态或超出直接上下文的时间范围方面,失败的程度如何?
- RQ4神经网络模型在时间推理任务上的表现与人类相比如何?其主要失败模式是什么?
- RQ5众包流程能否可靠地大规模生成高质量、多样化且具有对比性的时间推理问题?
主要发现
- RoBERTa-large 在 Torque 测试集上的精确匹配得分为 51%,表明其与人类表现之间存在显著差距。
- 人类在测试集上的精确匹配得分为约 81%,表明该任务具有挑战性,尚未被当前模型完全解决。
- 在 SQuAD 上训练的模型无法泛化到时间推理任务,表现为无法正确回答对比性问题,如 'what happened before' 与 'what happened after'。
- 即使在 Torque 上进行微调,性能差距依然存在,表明当前模型架构缺乏足够的时间推理归纳偏置。
- 该数据集表明,当存在多个事件或时间线索嵌入复杂句法结构时,模型往往无法识别正确的时间事件序列。
- 对比性问题设计有效暴露了模型的脆弱性:问题措辞的微小变化(例如 'before' 变为 'after')会导致模型输出截然不同的答案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。