Skip to main content
QUICK REVIEW

[论文解读] Cross-Document Event Coreference Resolution Beyond Corpus-Tailored Systems.

Michael Bugert, Nils Reimers|arXiv (Cornell University)|Nov 24, 2020
Topic Modeling参考文献 44被引用 5
一句话总结

本文在三个不同语料库(ECB+、枪支暴力、足球共指)上评估了跨文档事件共指消解(CDCR),将统一的基于特征的系统与在ECB+上训练的神经网络模型进行对比。尽管绝对性能较低,但基于特征的系统在不同领域间泛化能力更强,揭示了现有神经网络系统过度拟合于特定语料库的模式,主张通过多语料库评估来提升CDCR的泛化能力。

ABSTRACT

Cross-document event coreference resolution (CDCR) is an NLP task in which mentions of events need to be identified and clustered throughout a collection of documents. CDCR aims to benefit downstream multi-document applications, but despite recent progress on corpora and model development, downstream improvements from applying CDCR have not been shown yet. The reason lies in the fact that every CDCR system released to date was developed, trained, and tested only on a single respective corpus. This raises strong concerns on their generalizability --- a must-have for downstream applications where the magnitude of domains or event mentions is likely to exceed those found in a curated corpus. To approach this issue, we define a uniform evaluation setup involving three CDCR corpora: ECB+, the Gun Violence Corpus and the Football Coreference Corpus (which we reannotate on token level to make our analysis possible). We compare a corpus-independent, feature-based system against a recent neural system developed for ECB+. Whilst being inferior in absolute numbers, the feature-based system shows more consistent performance across all corpora whereas the neural system is hit-and-miss. Via model introspection, we find that the importance of event actions, event time, etc. for resolving coreference in practice varies greatly between the corpora. Additional analysis shows that several systems overfit on the structure of the ECB+ corpus. We conclude with recommendations on how to move beyond corpus-tailored CDCR systems in the future -- the most important being that evaluation on multiple CDCR corpora is strongly necessary. To facilitate future research, we release our dataset, annotation guidelines, and model implementation to the public.

研究动机与目标

  • 为解决现有CDCR系统缺乏泛化能力的问题,这些系统通常仅在单一语料库上进行训练和测试。
  • 探究单一、统一的CDCR系统是否能在不同领域和事件类型中保持一致的性能表现。
  • 识别为何尽管在基准语料库上取得进展,现有CDCR系统仍无法提升下游应用性能的原因。
  • 分析语言特征(如事件动作、时间、论元)在不同语料库中对共指消解的作用。
  • 倡导在多个语料库上进行评估,作为构建稳健、可泛化的CDCR系统所必需的一步。

提出的方法

  • 设计了一个统一的、基于特征的CDCR系统,使用人工构建的语言学特征,如事件动作、时间表达和论元结构。
  • 对足球共指语料库进行了词级别重新标注,以确保其与其它语料库在跨语料库评估中的一致性。
  • 在三个不同的语料库(ECB+、枪支暴力、足球共指)上评估了基于特征的系统和在ECB+上训练的神经网络模型。
  • 通过模型内部分析,研究了不同语料库中特征重要性的差异,揭示了事件时间、动作和论元在不同领域中的相关性差异。
  • 采用跨语料库评估方法,检测神经网络模型对单一语料库(尤其是ECB+)结构模式的过拟合现象,特别是在论元结构和提及分布方面。
  • 发布了重新标注的足球共指语料库、标注指南和模型代码,以支持可复现性及未来研究。

实验结果

研究问题

  • RQ1与专为单一语料库定制的神经网络模型相比,单一、统一的基于特征的CDCR系统在多个多样化语料库上的表现如何?
  • RQ2在不同领域中,事件动作、时间表达和论元等语言学特征在共指消解中的贡献程度如何?
  • RQ3为何现有CDCR系统无法超越其训练语料库进行泛化?它们表现出哪些结构性偏差?
  • RQ4多语料库评估能否揭示在单一基准上表现优异但实际过拟合于特定语料库的神经网络CDCR模型?
  • RQ5除了针对特定语料库的开发,构建可泛化的CDCR系统还需要哪些关键条件?

主要发现

  • 尽管在绝对性能上较低,但基于特征的CDCR系统在所有三个语料库中表现出更一致的性能,优于神经网络模型。
  • 在ECB+上训练的神经网络模型在枪支暴力和足球共指语料库上的表现较差,表明其存在强烈的领域特异性过拟合。
  • 特征重要性在不同语料库中存在显著差异——在ECB+中事件动作至关重要,而在枪支暴力语料库中时间表达更为关键。
  • 多个CDCR系统(包括神经网络模型)过度拟合于ECB+语料库的句法和结构模式,特别是在论元结构和提及分布方面。
  • 本研究证明,仅在一个语料库上进行评估不足以衡量泛化能力,多语料库评估对于可靠评估系统至关重要。
  • 在词级别重新标注的足球共指语料库使得更准确、一致的跨语料库比较成为可能,为未来研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。