Skip to main content
QUICK REVIEW

[论文解读] An Improved Neural Baseline for Temporal Relation Extraction

Ning Qiang, Sanjay Subramanian|arXiv (Cornell University)|Sep 1, 2019
Topic Modeling参考文献 45被引用 4
一句话总结

本文提出了一种基于上下文嵌入、时序常识知识的孪生编码器以及整数线性规划的强效神经基线模型,用于时间关系抽取。在两个基准数据集上,该模型相比先前最先进方法实现了10%的F1绝对提升(错误率降低25%),表明模型性能的瓶颈更多源于数据质量而非模型架构。

ABSTRACT

Determining temporal relations (e.g., before or after) between events has been a challenging natural language understanding task, partly due to the difficulty to generate large amounts of high-quality training data. Consequently, neural approaches have not been widely used on it, or showed only moderate improvements. This paper proposes a new neural system that achieves about 10% absolute improvement in accuracy over the previous best system (25% error reduction) on two benchmark datasets. The proposed system is trained on the state-of-the-art MATRES dataset and applies contextualized word embeddings, a Siamese encoder of a temporal common sense knowledge base, and global inference via integer linear programming (ILP). We suggest that the new approach could serve as a strong baseline for future research in this area.

研究动机与目标

  • 解决神经模型在时间关系抽取任务中因训练数据质量低下而导致的性能受限问题。
  • 评估在该任务中,神经架构还是数据质量是主要瓶颈。
  • 为未来时间关系抽取研究建立一个强大且公开可用的神经基线。
  • 探究不同词嵌入技术与知识注入对模型性能的影响。

提出的方法

  • 使用Bi-LSTM编码器结合上下文嵌入(ELMo、BERT)来表示包含事件的句子对。
  • 采用孪生神经网络编码来自TemProb的时间常识知识,注入关于典型事件排序的先验知识。
  • 应用整数线性规划(ILP)进行全局推理,以强制实施预测时间关系之间的传递性约束。
  • 通过位置感知编码与拼接策略,将事件表示与相对事件顺序建模相结合,提升建模效果。
  • 在MATRES数据集上端到端训练,该数据集相比以往数据集具有更高的标注质量与标注者一致性。
  • 采用包含准确率、精确率/召回率/F1以及意识得分的三重评估框架,全面评估模型性能。

实验结果

研究问题

  • RQ1神经模型与基于特征的方法在时间关系抽取中的性能差距,是源于模型架构还是数据质量?
  • RQ2不同上下文嵌入方法(如BERT、ELMo)在时间关系抽取任务中的性能表现如何比较?
  • RQ3注入外部时间常识知识在多大程度上能提升神经模型的性能?
  • RQ4通过整数线性规划进行全局推理,能否提升时间关系预测的一致性与准确性?
  • RQ5所提出的系统是否可作为未来时间关系抽取研究的强效、可泛化基线?

主要发现

  • 所提系统在MATRES数据集上相比先前最先进系统CogCompTime实现了10%的F1绝对提升与25%的错误率降低。
  • 上下文嵌入(ELMo与BERT)显著优于静态嵌入(word2vec、GloVe、FastText),McNemar检验p < 0.001。
  • 无论使用ELMo还是BERT,添加常识编码器(CSE)相比基线拼接策略均显著提升性能,p < 0.001。
  • 当使用BERT并完整集成全部模块时,模型在MATRES上达到78.4的F1,在TCR上达到74.9,显著优于CogCompTime。
  • 本研究证实,高质量数据(如MATRES)可使神经模型超越以往基于特征的系统,表明数据质量是关键瓶颈。
  • 尽管BERT在其他NLP任务中表现占优,但在本研究中ELMo与BERT之间未发现显著性能差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。