[论文解读] Improving Event Causality Identification via Self-Supervised Representation Learning on External Causal Statement
本文提出 CauSeRL,一种自监督表示学习框架,通过利用外部因果陈述来提升事件因果关系识别(ECI)性能。通过对比自监督学习方式学习上下文相关的因果模式,并采用对比知识蒸馏策略进行迁移,CauSeRL 实现了最先进性能,在 EventStoryLine 和 Causal-TimeBank 上分别将 F1 提升了 +2.0 和 +3.4。
Current models for event causality identification (ECI) mainly adopt a supervised framework, which heavily rely on labeled data for training. Unfortunately, the scale of current annotated datasets is relatively limited, which cannot provide sufficient support for models to capture useful indicators from causal statements, especially for handing those new, unseen cases. To alleviate this problem, we propose a novel approach, shortly named CauSeRL, which leverages external causal statements for event causality identification. First of all, we design a self-supervised framework to learn context-specific causal patterns from external causal statements. Then, we adopt a contrastive transfer strategy to incorporate the learned context-specific causal patterns into the target ECI model. Experimental results show that our method significantly outperforms previous methods on EventStoryLine and Causal-TimeBank (+2.0 and +3.4 points on F1 value respectively).
研究动机与目标
- 为解决事件因果关系识别(ECI)中标签数据有限的问题,该问题限制了模型在未见情况下的泛化能力。
- 利用大规模、未标注的外部因果陈述,学习在小型标注数据集中无法获取的上下文相关因果模式。
- 开发一种方法,将这些学习到的因果模式有效迁移至目标 ECI 模型中,而无需完全依赖人工标注样本。
- 提升 ECI 模型的泛化能力和鲁棒性,尤其是在训练数据有限的低资源场景下。
提出的方法
- 设计一种自监督对比学习框架,从未标注的外部因果陈述中提取上下文相关的因果模式。
- 采用双编码器结构,比较两个采样的因果陈述,学习捕捉潜在因果结构的共享表示。
- 应用对比迁移策略,其中教师模型(自监督编码器)指导学生模型(ECI 模型)对齐因果事件表示。
- 最大化教师与学生表示之间的互信息,以确保因果知识的有效迁移。
- 在微调过程中冻结自监督编码器,以防止表示崩溃并维持稳定的表示学习。
- 使用 BERT 或 BiLSTM 作为主干编码器,自监督阶段优选 BiLSTM 以避免预训练权重带来的梯度干扰。
实验结果
研究问题
- RQ1在外部因果陈述上进行自监督表示学习,能否提升对未见事件对因果关系的识别能力?
- RQ2对比迁移在将外部陈述中的上下文相关因果模式迁移到下游 ECI 模型方面有多有效?
- RQ3利用外部因果陈述是否优于直接在这些数据上微调或传统基于特征的方法?
- RQ4所提出方法在标签数据有限的低资源场景下,其泛化能力达到何种程度?
主要发现
- CauSeRL 在 EventStoryLine 和 Causal-TimeBank 上均达到最先进性能,分别将 F1 提升了 +2.0 和 +3.4。
- 移除自监督表示学习(SelfRL)组件后性能显著下降,证实其在捕捉上下文相关因果模式中的关键作用。
- 对比迁移策略(ConRT)至关重要:若移除该策略,性能出现明显下降,表明仅直接使用学习到的表示无法有效发挥作用,必须经过适当的对齐。
- 即使未在外部陈述上进行预训练,仅对比迁移策略本身即可提升 ECI 性能,表明其在知识蒸馏中的有效性。
- 模型在 Causal-TimeBank 上的性能显著提升,该数据集标签数据更少,证明了该方法在低资源场景下的价值。
- 案例研究显示,外部因果陈述提升了模型置信度,并纠正了如 'noticed' 与 'alerted' 事件之间的误分类关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。