[论文解读] MAVEN: A Massive General Domain Event Detection Dataset
MAVEN 是一个大规模、人工标注的事件检测数据集,包含 4,480 篇维基百科文档、118,732 个事件提及和 168 种事件类型,源自 FrameNet 以确保广泛的一般领域覆盖。在最先进模型上的评估显示性能显著下降,表明一般领域事件检测仍是具有挑战性的开放性问题,亟需进一步研究。
Event detection (ED), which means identifying event trigger words and classifying event types, is the first and most fundamental step for extracting event knowledge from plain text. Most existing datasets exhibit the following issues that limit further development of ED: (1) Data scarcity. Existing small-scale datasets are not sufficient for training and stably benchmarking increasingly sophisticated modern neural methods. (2) Low coverage. Limited event types of existing datasets cannot well cover general-domain events, which restricts the applications of ED models. To alleviate these problems, we present a MAssive eVENt detection dataset (MAVEN), which contains 4,480 Wikipedia documents, 118,732 event mention instances, and 168 event types. MAVEN alleviates the data scarcity problem and covers much more general event types. We reproduce the recent state-of-the-art ED models and conduct a thorough evaluation on MAVEN. The experimental results show that existing ED methods cannot achieve promising results on MAVEN as on the small datasets, which suggests that ED in the real world remains a challenging task and requires further research efforts. We also discuss further directions for general domain ED with empirical analyses. The source code and dataset can be obtained from https://github.com/THU-KEG/MAVEN-dataset.
研究动机与目标
- 为解决现有事件检测(ED)数据集存在的数据稀缺和一般领域事件覆盖不足的问题。
- 创建一个大规模、人工标注的数据集,以支持现代神经网络 ED 模型的训练与基准测试。
- 通过扩展事件类型覆盖范围,超越狭窄且专门化的类型模式,提升 ED 模型的泛化能力。
- 支持对长尾事件类型、数据不平衡和细粒度类型区分等挑战的实证分析。
- 为未来在多事件建模、层次化类型模式利用以及 ED 中的迁移学习研究提供基础。
提出的方法
- 基于 FrameNet 的语言框架,从 4,480 篇维基百科文档构建 MAVEN,以定义全面且经人工验证的事件类型模式。
- 基于 FrameNet 构建分层树状结构的事件类型模式,以提升语义覆盖范围并支持细粒度分类。
- 对 118,732 个事件提及进行人工标注,包括事件触发词和 168 种不同的事件类型,确保高质量、多样化且一般领域覆盖。
- 在 MAVEN 上复现并评估最先进神经网络 ED 模型,以评估其在更真实、更复杂的基准上的表现。
- 通过消融研究和实证分析,评估数据不平衡、分层类型模式和多事件关联的影响。
- 通过 GitHub 开源发布数据集和代码,以促进可复现性和社区采纳。
实验结果
研究问题
- RQ1与现有基准相比,最先进神经网络事件检测模型在大规模一般领域数据集 MAVEN 上的表现如何?
- RQ2数据不平衡和长尾事件类型分布在多大程度上影响模型在真实世界 ED 任务中的泛化能力?
- RQ3分层事件类型模式是否能提升模型在区分语义相似或密切相关事件类型方面的能力?
- RQ4在 MAVEN 上的低资源事件检测场景中,迁移学习和数据增强策略的有效性如何?
- RQ5当前 ED 模型在应用于一般领域文本时的主要失败模式是什么,以及如何加以缓解?
主要发现
- 最先进 ED 模型在 MAVEN 上的表现相比 ACE 2005 等较小基准出现显著下降,表明真实世界一般领域事件检测仍是具有挑战性的任务。
- 最常见的错误类型是“识别错误”,即模型未能检测到触发词或将其误标为 N/A,突显了在复杂语言中识别事件语义的困难。
- 在分层模式中,父-子或兄弟事件类型之间的“事件类型错误”占比较高,表明模型在细粒度语义区分上存在困难。
- 对高频事件类型(前 50%)的误分类现象普遍存在,表明模型受数据不平衡影响严重,难以泛化到低资源类型。
- 分层事件类型模式在提升相近事件类型区分能力方面显示出潜力,可能有助于更好的数据平衡与增强策略。
- 实证分析表明,在单个句子中建模多个事件是提升复杂文本 ED 性能的有前景方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。