Skip to main content
QUICK REVIEW

[论文解读] Temporal Common Sense Acquisition with Minimal Supervision

Ben Zhou, Qiang Ning|arXiv (Cornell University)|May 8, 2020
Topic Modeling参考文献 42被引用 12
一句话总结

该论文提出TacoLM,一种序列建模范式,通过从无标注文本中利用句法规则和时间维度的联合建模,以弱监督方式获取时间常识——持续时间、频率和典型时间。其在内在评估中比BERT提升19%,并在事件关系抽取和时间问答等外在任务中表现更优,展现出对报告偏差和时间单位序数关系的鲁棒性。

ABSTRACT

Temporal common sense (e.g., duration and frequency of events) is crucial for understanding natural language. However, its acquisition is challenging, partly because such information is often not expressed explicitly in text, and human annotation on such concepts is costly. This work proposes a novel sequence modeling approach that exploits explicit and implicit mentions of temporal common sense, extracted from a large corpus, to build TACOLM, a temporal common sense language model. Our method is shown to give quality predictions of various dimensions of temporal common sense (on UDST and a newly collected dataset from RealNews). It also produces representations of events for relevant tasks such as duration comparison, parent-child relations, event coreference and temporal QA (on TimeBank, HiEVE and MCTACO) that are better than using the standard BERT. Thus, it will be an important component of temporal NLP.

研究动机与目标

  • 为解决自然语言中时间常识(TCS)获取的挑战,其中持续时间、频率和典型时间常为隐含且因报告偏差而代表性不足。
  • 克服标准预训练语言模型(如BERT)的局限性,其无法建模时间单位间的序数关系,且缺乏对TCS维度的显式监督。
  • 开发一种方法,利用自由文本中的弱监督信号,联合建模TCS的多个维度(持续时间、频率、典型时间)。
  • 提升需要时间推理的下游NLP任务表现,如事件共指消解、父子关系抽取和时间问答。

提出的方法

  • 该方法利用句法规则从大规模无标注语料(如Gigaword)中提取时间常识的显性和隐性提及,生成弱监督信号。
  • 提出一种序列建模范式,联合预测持续时间、频率和典型时间在时间单位上的分布,建模序数关系(如分钟 < 小时 < 天)。
  • 在这些弱监督信号上进行预训练,使模型学会区分并表征不同时间维度,从而在显式提及之外实现更好的泛化。
  • 引入一种特殊的分词方案,将时间表达替换为学习得到的特殊标记,以更好地建模时间单位的语义。
  • 利用维度间的联合关系——例如,利用罕见事件的上界(如“在火灾警报期间”暗示“开门”持续时间 < 警报持续时间)来推断常见持续时间。
  • 在下游任务(如事件关系分类和时间问答)上进行微调,使用编码器的表示进行序列分类。

实验结果

研究问题

  • RQ1模型能否仅通过无标注文本的弱监督,预测事件的持续时间、频率和典型时间分布?
  • RQ2模型在报告偏差下表现如何,即常见事件在文本中代表性不足而罕见事件被过度表示?
  • RQ3对多个时间维度的联合建模能否提升泛化与推理能力,超越标准BERT的性能?
  • RQ4在时间单位间引入序数关系(如分钟 < 小时)在多大程度上改善了预测质量?
  • RQ5模型对事件的表征是否能提升下游任务中时间常识推理的性能?

主要发现

  • 在RealNews和UDST的内在评估中,TacoLM相比基线模型提升19%,证明其在预测时间常识分布方面表现强劲。
  • 在持续时间预测任务中,TacoLM相比原始BERT提升40%,分布更准确且更接近黄金标签的单峰分布。
  • 在HiEVE数据集上,TacoLM在共指任务上提升4%,在父子关系任务上提升8%,表明其通过时间推理增强了事件层级建模能力。
  • 在McTaco数据集上,TacoLM在持续时间(34.6% vs. 33.4%)、频率(45.1% vs. 43.3%)和典型时间(40.9% vs. 39.5%)的精确匹配得分上均更高,证实其在时间问答任务中的优势。
  • 模型通过利用隐含约束(如罕见事件的上界)推断常见持续时间,对报告偏差表现出鲁棒性,这是文献中的新颖贡献。
  • 尽管性能有所提升,McTaco中排序维度的性能略有下降,表明建模相对时间顺序仍具挑战,需进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。