Skip to main content
QUICK REVIEW

[论文解读] Knowledge-Augmented Language Models for Cause-Effect Relation Classification

Pedram Hosseini, David Broniatowski|arXiv (Cornell University)|Dec 16, 2021
Topic Modeling被引用 4
一句话总结

本文提出了一种知识增强的预训练框架,通过在 ATOMIC²⁰ 和 GLUCOSE 中自动语义化的常识知识上持续预训练 BERT 和 RoBERTa,从而提升其在因果关系分类任务上的性能。该方法在不改变模型架构或使用高质量微调数据的情况下,在 COPA、BCOPA-CE 和 TCR 基准测试上显著提升了性能,RoBERTa-Large 在 COPA-test 上达到了 85.7% 的准确率。

ABSTRACT

Previous studies have shown the efficacy of knowledge augmentation methods in pretrained language models. However, these methods behave differently across domains and downstream tasks. In this work, we investigate the augmentation of pretrained language models with commonsense knowledge in the cause-effect relation classification and commonsense causal reasoning tasks. After automatically verbalizing ATOMIC2020, a wide coverage commonsense reasoning knowledge graph, and GLUCOSE, a dataset of implicit commonsense causal knowledge, we continually pretrain BERT and RoBERTa with the verbalized data. Then we evaluate the resulting models on cause-effect pair classification and answering commonsense causal reasoning questions. Our results show that continually pretrained language models augmented with commonsense knowledge outperform our baselines on two commonsense causal reasoning benchmarks, COPA and BCOPA-CE, and the Temporal and Causal Reasoning (TCR) dataset, without additional improvement in model architecture or using quality-enhanced data for fine-tuning.

研究动机与目标

  • 探究常识知识注入对预训练语言模型中因果关系分类的影响。
  • 评估使用自动语义化知识进行持续预训练是否能提升在因果推理基准上的性能。
  • 证明知识增强可在不修改模型架构或使用高质量微调数据的情况下提升性能。
  • 发布代码和模型以支持可复现性及社区使用。

提出的方法

  • 使用人类可读的模板对 ATOMIC²⁰ 知识图谱中的三元组进行语义化,生成自然语言陈述。
  • 使用修改后的因果连接词模板,将 GLUCOSE 中隐式的因果知识转化为自然语言。
  • 在语义化的常识知识上,使用掩码语言建模对 BERT 和 RoBERTa 进行持续预训练。
  • 使用微调后的模型对因果对数据集进行零样本或少样本分类。
  • 在不进行额外微调或损失函数修改的情况下,评估在 COPA、BCOPA-CE 和 TCR 基准上的性能。
  • 在基线性能接近随机时,应用提示工程(如“因为”或“因此,”)以提升在 BCOPA-CE 上的性能。

实验结果

研究问题

  • RQ1使用自动语义化常识知识进行持续预训练,能否提升预训练语言模型在因果关系分类任务中的性能?
  • RQ2与标准微调相比,ATOMIC²⁰ 和 GLUCOSE 的知识增强在因果推理基准上的表现如何?
  • RQ3性能提升是否在困难样本和隐式因果推理任务上依然成立?
  • RQ4与 T5-11B 等更大模型相比,知识增强预训练是否能让较小模型(如 BERT-Large)获得具有竞争力的性能?
  • RQ5提示工程是否能进一步提升在模糊或隐式因果推理任务上的性能?

主要发现

  • 在 GLUCOSE 语义化数据上微调的 RoBERTa-Large 在 COPA-test 上达到 85.7% 的准确率,优于基线 RoBERTa-Large(74.1%),且尽管参数量更少,仍超过更大模型 T5-11B(94.8%)的准确率。
  • 在 COPA 的困难样本子集上,GLUCOSE 增强的 RoBERTa-Large 达到 83.3% 的准确率,显著优于基线 RoBERTa-Large(70.2%),展现出在挑战性样本上的鲁棒性。
  • 在仅使用事件相关关系的 ATOMIC²⁰ 增强下,RoBERTa-Large 在 COPA 上达到 84.9% 的准确率,表明即使仅使用常识知识的子集,性能也能得到提升。
  • 在 BCOPA-CE 上,使用提示工程的 GLUCOSE 增强 RoBERTa-Large 达到 66.1% 的准确率,优于 Han 和 Wang(2021)的 b-l-aug 和 b-l-reg 模型。
  • 知识增强模型在 TCR 数据集上优于基线模型,且无需任何架构修改或额外微调数据,证实了使用常识知识进行持续预训练的有效性。
  • 作者发布了代码和模型,支持可复现性,并推动知识增强因果推理领域的进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。