Skip to main content
QUICK REVIEW

[论文解读] UniCausal: Unified Benchmark and Repository for Causal Text Mining

Fiona Anting Tan, Xinyu Zuo|arXiv (Cornell University)|Aug 19, 2022
Topic Modeling被引用 10
一句话总结

UniCausal 提出了一项统一的基准和代码库,用于因果文本挖掘,整合了六个由人工标注的数据集,涵盖三项任务:因果序列分类、因果跨度检测和因果对分类。它提供了标准化、对齐的标注以及基线 BERT 模型,在三项任务上的 F1 分数分别为 70.10%(二分类)、52.42%(宏平均 F1)和 84.68%,实现了公平、可扩展的评估,并支持在多样化因果文本挖掘目标上的联合建模。

ABSTRACT

Current causal text mining datasets vary in objectives, data coverage, and annotation schemes. These inconsistent efforts prevent modeling capabilities and fair comparisons of model performance. Furthermore, few datasets include cause-effect span annotations, which are needed for end-to-end causal relation extraction. To address these issues, we propose UniCausal, a unified benchmark for causal text mining across three tasks: (I) Causal Sequence Classification, (II) Cause-Effect Span Detection and (III) Causal Pair Classification. We consolidated and aligned annotations of six high quality, mainly human-annotated, corpora, resulting in a total of 58,720, 12,144 and 69,165 examples for each task respectively. Since the definition of causality can be subjective, our framework was designed to allow researchers to work on some or all datasets and tasks. To create an initial benchmark, we fine-tuned BERT pre-trained language models to each task, achieving 70.10% Binary F1, 52.42% Macro F1, and 84.68% Binary F1 scores respectively.

研究动机与目标

  • 为解决因果文本挖掘中因数据集不一致、标注方案和任务定义差异而导致的缺乏标准化、统一基准的问题。
  • 将六个高质量、人工标注的因果文本挖掘数据集整合到统一框架中,以实现对三项核心任务的一致评估。
  • 使研究人员能够基于单一或组合数据集训练和评估模型,支持任务特定和联合建模方法。
  • 提供具有竞争力的基线模型和开源代码,包含 Hugging Face 模型检查点,以确保可复现性和公平比较。
  • 通过整合显式和隐式因果关系,涵盖句内和句间语境中的多样化因果信号类型,推动可泛化的端到端因果关系抽取。

提出的方法

  • 作者将六个现有的因果文本挖掘数据集——AltLex、BECAUSE 2.0、CausalTimeBank、EventStoryLine、PDTB v3.0 和 SemEval 2010 Task 8——统一到三项任务的标准化标注模式中。
  • 针对每项任务,团队对齐并标准化了标注:(I) 序列级因果分类,(II) 跨度级因果边界检测,(III) 对级因果关系分类。
  • 开发了一个模块化代码库,支持在不同数据集和任务间灵活加载数据、训练和评估模型,通过命令行接口可轻松集成新数据集。
  • 使用统一的数据划分对预训练 BERT 模型进行微调,针对每项任务的目标优化超参数。
  • 采用五折交叉验证,基于五个随机种子进行评估,报告的 F1 分数为均值 ± 标准差。
  • 该框架支持迁移学习实验,例如在 CauseNet 上进行微调,以评估模型的泛化能力和对语言变异的敏感性。

实验结果

研究问题

  • RQ1统一的基准是否能提升在多样化数据集和标注方案下因果文本挖掘模型评估的一致性和公平性?
  • RQ2当在整合的标准化数据集上训练时,基线模型在不同因果文本挖掘任务上的表现如何?
  • RQ3与基于规则或模板的数据集(如 CauseNet)相比,将人工标注中多样的语言模式纳入模型是否能显著提升模型的泛化能力?
  • RQ4在多个因果文本挖掘任务上进行联合建模,是否能带来优于任务特定训练的性能和泛化效果?
  • RQ5包含句间和隐式因果关系是否会影响模型性能和标注复杂度?

主要发现

  • 使用微调后的 BERT 模型,统一基准在因果序列分类任务上达到 70.10% 的二分类 F1 分数,在因果跨度检测任务上达到 52.42% 的宏平均 F1 分数,在因果对分类任务上达到 84.68% 的二分类 F1 分数。
  • 从 CauseNet 进行迁移学习仅在 CTB(77.08%)和 AltLex(85.04%)上提升了性能,表明由于基于规则数据的语言变异性较低,迁移能力有限。
  • 在 UniCausal 上训练的模型在 SemEval(94.71% F1)和 BECAUSE(91.21% F1)上表现优异,表明人工标注且语言多样化的数据具有重要价值。
  • 当在 UniCausal 上训练并在 CauseNet 上测试时,模型表现极差(F1 仅为 10.11%),凸显了将模型泛化到低变异性、基于规则的样本时的挑战。
  • 跨数据集迁移性能普遍较低,最佳结果出现在训练和测试数据集相同时,表明存在领域偏移和标注分布差异。
  • 该框架成功通过即插即用的数据加载接口实现了新数据集(如 CauseNet)的模块化集成,展示了良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。