Skip to main content
QUICK REVIEW

[论文解读] LearnDA: Learnable Knowledge-Guided Data Augmentation for Event Causality Identification

Xinyu Zuo, Pengfei Cao|arXiv (Cornell University)|Jun 3, 2021
Topic Modeling参考文献 49被引用 7
一句话总结

本文提出 LearnDA,一种可学习的、基于知识引导的数据增强框架,用于事件因果关系识别(ECI),通过双学习机制迭代生成任务特定、因果连贯且语法正确的句子。通过联合优化句子生成与因果关系分类,并利用外部知识库,LearnDA 在 EventStoryLine 和 Causal-TimeBank 数据集上的 F1 分数分别提升了 +2.5 和 +2.1,优于现有的数据增强方法。

ABSTRACT

Modern models for event causality identification (ECI) are mainly based on supervised learning, which are prone to the data lacking problem. Unfortunately, the existing NLP-related augmentation methods cannot directly produce the available data required for this task. To solve the data lacking problem, we introduce a new approach to augment training data for event causality identification, by iteratively generating new examples and classifying event causality in a dual learning framework. On the one hand, our approach is knowledge-guided, which can leverage existing knowledge bases to generate well-formed new sentences. On the other hand, our approach employs a dual mechanism, which is a learnable augmentation framework and can interactively adjust the generation process to generate task-related sentences. Experimental results on two benchmarks EventStoryLine and Causal-TimeBank show that 1) our method can augment suitable task-related training data for ECI; 2) our method outperforms previous methods on EventStoryLine and Causal-TimeBank (+2.5 and +2.1 points on F1 value respectively).

研究动机与目标

  • 解决事件因果关系识别(ECI)中的数据稀缺问题,该问题因标注数据集较小而限制了模型性能。
  • 克服现有 NLP 数据增强方法(任务无关)在生成句子中无法保持因果关系与语言质量的局限性。
  • 开发一种可学习的、基于知识引导的框架,通过建模句子生成与因果关系分类之间的双重性,为 ECI 生成高质量、任务相关的训练数据。
  • 确保生成的句子在因果关系上有效且语法正确,包含恰当的语法结构、语义角色和连贯的因果表达。
  • 证明通过知识注入实现的交互式双学习机制,相比现有方法能实现更有效的数据增强。

提出的方法

  • LearnDA 采用双学习框架,将事件因果关系识别(分类)与句子生成(生成)建模为双重任务。
  • 该框架利用外部知识库注入有效的因果事件对(例如,attack → killed),以指导初始生成过程,确保因果关系的正确性。
  • 采用约束性生成架构,迭代填补缺失的连贯词语(例如,'because', 'thus'),同时保留给定的事件与实体,从而提升句子的语法正确性。
  • 生成器与分类器进行迭代交互:分类器评估生成句子的因果关系,反馈信息用于指导生成器改进后续输出。
  • 知识引导的初始化确保生成的句子基于真实的因果关系,而双学习机制则实现两个模块的端到端优化。
  • 采用自动(BLEU)与人工(4 分制)指标对因果关系、语法正确性与多样性进行评估。

实验结果

研究问题

  • RQ1一种同时从因果关系识别与句子生成中联合学习的数据增强框架,是否能生成比任务无关方法更高质量的 ECI 训练数据?
  • RQ2知识注入在多大程度上提升了 ECI 中生成句子的因果关系与语法正确性?
  • RQ3双学习机制如何增强生成句子与目标 ECI 任务之间的对齐?
  • RQ4与 EDA、回译法及文本表面方法相比,所提出的框架是否能生成更多样化且语义准确的因果句子?
  • RQ5当用于扩充有限的训练数据时,该框架是否能提升下游 ECI 任务的性能?

主要发现

  • LearnDA 在两个基准数据集上达到最先进性能,在 EventStoryLine 上 F1 分数提升 +2.5,在 Causal-TimeBank 上提升 +2.1。
  • 人工评估显示,LearnDA 生成的句子在因果关系方面得分为 3.60,在语法正确性方面得分为 3.64,显著优于 EDA(3.20 和 2.75)与回译法(3.70 和 3.83)。
  • LearnDA 生成句子的 BLEU 分数为 3.51(人工多样性)与 0.66(自动多样性),表明其在保持高质量的同时具备高多样性。
  • LearnDA 在 F1 分数与人工评估中均优于 EDA、回译法与文本表面方法,且在 0.05 显著性水平上具有显著提升。
  • 双学习机制通过反馈循环优化生成与分类两个模块,从而生成更准确、更符合任务需求的数据。
  • 来自外部知识库的知识注入显著提升了生成句子的因果关系质量,表现为人工评分更高及下游性能更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。