Skip to main content
QUICK REVIEW

[论文解读] "Going on a vacation" takes longer than "Going for a walk": A Study of Temporal Commonsense Understanding

Ben Zhou, Daniel Khashabi|arXiv (Cornell University)|Sep 6, 2019
Topic Modeling参考文献 36被引用 9
一句话总结

本文提出了McTaco,一个用于评估自然语言处理中时间常识理解的众包数据集,聚焦于五个维度:持续时间、时间顺序、典型时间、频率和稳定性。在McTaco上使用BERT及其他模型进行实验,作者发现即使是最先进的系统与人类表现相比仍存在显著差距——F1分数为69.9%,EM分数为42.7%,而人类表现分别为87.1%和75.8%,凸显了在时间推理能力方面存在关键差距。

ABSTRACT

Understanding time is crucial for understanding events expressed in natural language. Because people rarely say the obvious, it is often necessary to have commonsense knowledge about various temporal aspects of events, such as duration, frequency, and temporal order. However, this important problem has so far received limited attention. This paper systematically studies this temporal commonsense problem. Specifically, we define five classes of temporal commonsense, and use crowdsourcing to develop a new dataset, MCTACO, that serves as a test set for this task. We find that the best current methods used on MCTACO are still far behind human performance, by about 20%, and discuss several directions for improvement. We hope that the new dataset and our study here can foster more future research on this topic.

研究动机与目标

  • 系统研究并量化在自然语言理解中多个时间常识维度上的表现。
  • 解决尽管时间常识具有重要意义但长期缺乏统一评估框架和高质量数据集的问题。
  • 开发一个稳健的众包数据集(McTaco),以捕捉多样化的時間常識現象,并确保高标注质量。
  • 在该新基准上评估最先进NLP模型(如BERT和ESIM)的表现,以识别当前局限性。
  • 通过展示现有模型与人类水平的时间语义理解仍有显著差距,激励未来研究。

提出的方法

  • 本研究将时间常识划分为五个类别:持续时间、时间顺序、典型时间、频率和稳定性,每一类均需对事件进行不同类型的推理。
  • McTaco通过众包构建,辅以详细指南,确保在多样化时间推理类型中实现高质量、一致的标注。
  • 任务被定义为二分类:判断候选答案是否基于人类常识具有合理性,允许多个正确答案。
  • 基线模型包括使用GloVe和ELMo嵌入的ESIM,以及使用和不使用单位归一化的BERT,以处理数值型时间表达。
  • 性能通过在保留测试集上的F1和精确匹配(EM)分数进行评估,人类表现则在子集上评估以供比较。
  • 分析包括按类别划分的性能分解,以识别模型弱点,特别是处理数值时间单位和范围推理方面的不足。

实验结果

研究问题

  • RQ1当前最先进NLP模型在理解持续时间、频率和顺序等多样化时间常识现象方面表现如何?
  • RQ2预训练语言模型(如BERT)在表面共现之外,能在多大程度上捕捉细微的时间推理?
  • RQ3现有模型在时间常识推理方面,特别是在数值时间表达方面,存在哪些关键失败模式?
  • RQ4模型在不同类型时间常识上的表现如何变化?这揭示了其底层推理能力的哪些特征?
  • RQ5单位归一化能否提升模型在涉及数值的时间常识任务上的泛化能力?

主要发现

  • 表现最佳的模型(使用单位归一化的BERT)在McTaco上取得69.9%的F1和42.7%的EM,远低于人类的87.1% F1和75.8% EM。
  • 即使是最先进的语言模型BERT,也难以推断合理持续时间的范围,往往将离散时间术语视为独立关联,而非对范围进行推理。
  • 所有模型的F1与EM分数差距均超过30%,表明模型依赖表面形式匹配而非一致的时间推理。
  • 不同时间推理类别间的表现差异显著,其中‘稳定性’类问题的随机基线较高且模型表现较低,暗示存在数据或任务特定挑战。
  • 人类表现并非100%,这反映了常识判断的内在变异性,也证实了McTaco数据集的稳健性和高质量。
  • RoBERTa(更近期的模型)取得72.3%的F1和43.6%的EM,表明有小幅改进,但仍远未达到人类水平的理解能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。