Skip to main content
QUICK REVIEW

[论文解读] ERICA: Improving Entity and Relation Understanding for Pre-trained Language Models via Contrastive Learning

Yujia Qin, Yankai Lin|arXiv (Cornell University)|Dec 30, 2020
Topic Modeling参考文献 45被引用 13
一句话总结

ERICA 提出了一种对比学习框架,通过引入两项新型预训练任务——实体判别和关系判别,增强预训练语言模型对实体及其关系的理解。通过与掩码语言建模任务联合优化,ERICA 显著提升了 BERT 和 RoBERTa 在实体分类、关系抽取和问答任务上的表现,尤其在低资源条件下效果更显著。

ABSTRACT

Pre-trained Language Models (PLMs) have shown superior performance on various downstream Natural Language Processing (NLP) tasks. However, conventional pre-training objectives do not explicitly model relational facts in text, which are crucial for textual understanding. To address this issue, we propose a novel contrastive learning framework ERICA to obtain a deep understanding of the entities and their relations in text. Specifically, we define two novel pre-training tasks to better understand entities and relations: (1) the entity discrimination task to distinguish which tail entity can be inferred by the given head entity and relation; (2) the relation discrimination task to distinguish whether two relations are close or not semantically, which involves complex relational reasoning. Experimental results demonstrate that ERICA can improve typical PLMs (BERT and RoBERTa) on several language understanding tasks, including relation extraction, entity typing and question answering, especially under low-resource settings.

研究动机与目标

  • 解决传统预训练目标在显式建模文本中关系事实方面的局限性。
  • 通过捕捉跨句子的多个实体之间的交互关系以及复杂的推理模式,提升预训练语言模型(PLMs)对实体和关系的理解能力。
  • 开发一种可泛化的框架,增强 PLMs 执行多跳推理和上下文实体表征的能力。
  • 在关系事实抽取最具挑战性的低资源设置下,验证方法的有效性。
  • 提供一种基于对比学习的预训练方法,无需依赖外部知识图谱,即可提升下游语言理解任务的性能。

提出的方法

  • 引入实体判别任务,模型在给定头实体和关系的前提下,区分正确的尾实体,通过关系上下文提升实体层面的理解。
  • 提出关系判别任务,用于判断两个关系在语义上是否相似,从而隐式建模复杂的推理关系链。
  • 使用文档级别的远程监督构建正样本和负样本关系对,使模型能够学习关系之间的语义相似性。
  • 在预训练过程中,将新的对比目标(实体判别和关系判别)与标准的掩码语言建模(MLM)相结合。
  • 采用实例级别的负样本进行对比学习,正样本对基于共享实体或语义相似的关系构建。
  • 支持多种实体编码策略(平均池化和标记符编码),确保与不同下游任务设置的兼容性。

实验结果

研究问题

  • RQ1对比学习能否提升预训练语言模型对上下文中实体及其关系的理解?
  • RQ2所提出的实体判别任务在通过关系上下文增强实体表征方面有多有效?
  • RQ3关系判别任务在多大程度上提升了模型捕捉关系间语义相似性以及支持多跳推理的能力?
  • RQ4ERICA 是否在不同实体编码方法和下游任务上均具有泛化能力?
  • RQ5与标准微调和其他基线方法相比,ERICA 在低资源设置下的表现如何?

主要发现

  • ERICA 在多个自然语言处理任务上均提升了 BERT 和 RoBERTa 的性能,包括关系抽取、实体分类和问答任务,在 DocRED 基准上表现一致优异。
  • 在 DocRED 的 1% 训练数据划分下,ERICA 将 F1 提升 11.4 个百分点(从 30.4 提升至 38.5),IgF1 提升 7.4 个百分点(从 28.9 提升至 36.3),显著优于标准 BERT。
  • 在 100% 训练数据下,ERICA 在 DocRED 上取得 F1 为 58.2 和 IgF1 为 55.9 的成绩,优于标准 BERT 和其他基线模型。
  • 在大规模预训练设置下,实体标记符编码策略的性能优于平均池化;而在低资源设置下,平均池化表现更优。
  • t-SNE 可视化结果表明,与标准 BERT 相比,ERICA 学习到的实体和关系聚类更加紧凑且语义更明确。
  • 该框架在不同实体编码方法下均表现出鲁棒性,无论采用何种表征策略,均能保持一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。