Skip to main content
QUICK REVIEW

[论文解读] KnowDis: Knowledge Enhanced Data Augmentation for Event Causality Detection via Distant Supervision

Xinyu Zuo, Yubo Chen|arXiv (Cornell University)|Oct 21, 2020
Topic Modeling参考文献 27被引用 6
一句话总结

KnowDis 提出了一种基于知识增强的远程监督框架,用于事件因果关系检测(ECD),通过利用词汇和因果常识知识,自动生成高质量的训练数据。通过整合词典增强标注器、常识过滤器以及重标注/退火策略,KnowDis 显著提升了 ECD 的性能,在 EventStoryLine 和 Causal-TimeBank 数据集上使用远程标注数据实现了最先进(SOTA)的结果。

ABSTRACT

Modern models of event causality detection (ECD) are mainly based on supervised learning from small hand-labeled corpora. However, hand-labeled training data is expensive to produce, low coverage of causal expressions and limited in size, which makes supervised methods hard to detect causal relations between events. To solve this data lacking problem, we investigate a data augmentation framework for ECD, dubbed as Knowledge Enhanced Distant Data Augmentation (KnowDis). Experimental results on two benchmark datasets EventStoryLine corpus and Causal-TimeBank show that 1) KnowDis can augment available training data assisted with the lexical and causal commonsense knowledge for ECD via distant supervision, and 2) our method outperforms previous methods by a large margin assisted with automatically labeled training data.

研究动机与目标

  • 解决事件因果关系检测(ECD)中人工标注训练数据稀缺的问题,该问题限制了模型性能。
  • 通过自动生成高质量的训练样本,克服现有 ECD 数据集覆盖范围低和规模小的问题。
  • 通过整合词汇和因果常识知识,提升远程标注数据的质量,以减少噪声并增强因果语义表达。
  • 开发一个稳健的数据增强流水线,通过过滤、重标注和退火策略,有效利用噪声较多的远程监督数据进行 ECD。
  • 在使用知识增强的自动标注训练数据基础上,实现在 ECD 基准测试上的最先进性能。

提出的方法

  • 一个词典增强标注器(LexiAnno)利用同义词、上下位词和动词类别相似性,从 WordNet 和 VerbNet 中提取因果事件对,以扩展训练信号。
  • 一个常识过滤器(CommonFilter)通过利用因果常识知识,对远程标注的句子进行精炼,提升因果表达的语义合理性。
  • 应用重标注和退火策略,以减少噪声并提升模型在远程监督 ECD 数据上的泛化能力。
  • 框架采用基于 transE 的嵌入相似性,并结合最大间隔损失,对高概率因果事件对进行排序与选择,用于远程标注。
  • 在 NYT 语料库上应用远程监督,其中从标注和提取的事件对中随机选择 5% 的句子作为训练数据进行标注。
  • 最终模型在人工标注数据与知识增强的远程训练数据组合上进行训练,通过重标注和学习率退火实现迭代优化。

实验结果

研究问题

  • RQ1能否有效利用来自 WordNet 和 VerbNet 的词汇知识,生成大量高概率的因果事件对,以实现 ECD 中的数据增强?
  • RQ2因果常识知识在多大程度上能提升远程标注句子的质量,特别是在语义合理性方面?
  • RQ3重标注和退火策略在多大程度上能减少噪声并提升模型在远程监督 ECD 数据上的性能?
  • RQ4在 ECD 基准测试中,集成知识增强的远程监督是否能带来显著的性能提升,相较于纯监督或非知识增强的弱监督方法?
  • RQ5保留远程训练数据的最优比例是多少,以在有效注入知识与噪声累积之间取得平衡?

主要发现

  • KnowDis 在 EventStoryLine 语料库上实现了 49.7 的新最先进 F1 分数,比之前最佳方法高出 4.4 分。
  • 通过 LexiAnno 提取的因果事件对的引入,相比仅使用标注对,F1 提升了 4.4 分,证明了知识扩展的价值。
  • 移除常识过滤器后,F1 下降 1.6 分,表明因果常识知识在精炼远程标注数据方面比词汇连接词更有效。
  • 重标注和退火策略均对性能提升有贡献:重标注减少噪声,退火提升模型在噪声数据上的收敛能力。
  • 当保留来自因果组的 50% 远程训练数据($D_n^c$)时,性能达到最优,因为更高的保留率会引入过多噪声,超过额外知识带来的收益。
  • 该方法显著优于基于 EDA 的数据增强方法,后者缺乏因果知识,证明在数据增强中整合因果特异性知识的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。