Skip to main content
QUICK REVIEW

[论文解读] Implicit Argument Prediction with Event Knowledge

Pengxiang Cheng, Katrin Erk|arXiv (Cornell University)|Feb 20, 2018
Topic Modeling参考文献 9被引用 7
一句话总结

本文提出一种基于叙事连贯性和实体显著性的神经模型,用于隐式论元预测,通过可扩展的完形填空式任务生成合成训练数据。该模型在合成数据集和真实数据集上均优于强基线模型,实现了最先进性能,且无需依赖人工标注特征。

ABSTRACT

Implicit arguments are not syntactically connected to their predicates, and are therefore hard to extract. Previous work has used models with large numbers of features, evaluated on very small datasets. We propose to train models for implicit argument prediction on a simple cloze task, for which data can be generated automatically at scale. This allows us to use a neural model, which draws on narrative coherence and entity salience for predictions. We show that our model has superior performance on both synthetic and natural data.

研究动机与目标

  • 通过完形填空式任务生成大规模合成数据,以解决隐式论元预测中训练数据稀缺的问题。
  • 通过结合叙事连贯性模型中的事件知识与实体显著性特征,提升隐式论元预测性能。
  • 证明在自动生成数据上进行训练时,简单的神经模型可超越复杂且依赖人工特征的基线模型。
  • 在OntoNotes生成的合成数据和Gerber与Chai(2010)数据集的真实数据上评估模型性能。
  • 探究显著性与叙事连贯性在识别未在句法上连接至谓词的隐式论元中的作用。

提出的方法

  • 作者设计了一项完形填空任务,基于事件上下文预测缺失的隐式论元,从而实现大规模自动数据生成。
  • 基于Granroth-Wilding与Clark(2016)的神经事件模型,计算候选实体与事件上下文之间的叙事连贯性得分。
  • 通过统计文本中每个实体的提及次数来估计实体显著性,优先选择被频繁提及的实体作为潜在的隐式论元。
  • 模型训练目标为选择叙事连贯性最高且结合显著性作为正则化信号的实体。
  • 通过生成将论元移至不同角色的负样本,将方法扩展至多隐式论元预测任务。
  • 增加填充/不填充分类器以过滤非论元候选,提升精确率而不损失召回率。

实验结果

研究问题

  • RQ1能否使用完形填空式任务生成大规模合成数据用于隐式论元预测?
  • RQ2结合叙事连贯性与实体显著性是否能提升隐式论元预测性能?
  • RQ3当在自动生成的数据上训练时,简单神经模型是否能超越复杂且依赖人工特征的模型?
  • RQ4显著性特征的引入对合成数据集和真实数据集的性能有何影响?
  • RQ5事件知识在预测隐式论元(尤其是宾语和介词宾语角色)方面贡献有多大?

主要发现

  • 在OntoNotes合成数据集上,加入显著性特征的EventComp模型F1得分为49.6,显著优于GCauto基线模型(F1 = 44.5)。
  • 引入显著性特征后,精确率与召回率均得到提升,证实隐式论元通常为文本中显著性较高的实体。
  • 多论元训练使F1得分提升22–23分,证明了扩展训练设置的有效性。
  • 使用4000万条训练样本的模型F1达到49.6,表明数据规模扩大带来了显著性能增益。
  • 即使未使用人工标注特征,所提模型仍优于原始Gerber与Chai(2012)模型,后者依赖FrameNet、PropBank与NomBank标注。
  • 填充/不填充分类器提升了精确率但降低了召回率,仅在与多论元训练结合时才带来F1的净提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。