Skip to main content
QUICK REVIEW

[论文解读] Prompt-based Zero-shot Relation Extraction with Semantic Knowledge Augmentation

Jiaying Gong, Hoda Eldardiry|arXiv (Cornell University)|Dec 8, 2021
Topic Modeling被引用 6
一句话总结

本文提出 ZS-SKA,一种基于提示的零样本关系抽取模型,通过语义知识增强技术,在无需标注训练数据的情况下识别未见关系。通过基于词级类比的翻译规则生成合成训练样本,并利用知识图谱构建加权虚拟标签提示,ZS-SKA 提升了零样本关系三元组抽取性能,在 FewRel、Wiki-ZSL 和 NYT 数据集上超越了当前最先进方法。

ABSTRACT

In relation triplet extraction (RTE), recognizing unseen relations for which there are no training instances is a challenging task. Efforts have been made to recognize unseen relations based on question-answering models or relation descriptions. However, these approaches miss the semantic information about connections between seen and unseen relations. In this paper, We propose a prompt-based model with semantic knowledge augmentation (ZS-SKA) to recognize unseen relations under the zero-shot setting. We present a new word-level analogy-based sentence translation rule and generate augmented instances with unseen relations from instances with seen relations using that new rule. We design prompts with weighted virtual label construction based on an external knowledge graph to integrate semantic knowledge information learned from seen relations. Instead of using the actual label sets in the prompt template, we construct weighted virtual label words. We learn the representations of both seen and unseen relations with augmented instances and prompts. We then calculate the distance between the generated representations using prototypical networks to predict unseen relations. Extensive experiments conducted on three public datasets FewRel, Wiki-ZSL, and NYT, show that ZS-SKA outperforms other methods under zero-shot setting. Results also demonstrate the effectiveness and robustness of ZS-SKA.

研究动机与目标

  • 解决未见关系缺乏标注训练样本的零样本关系三元组抽取挑战。
  • 通过将外部知识图谱中的语义知识整合到提示设计中,提升零样本关系抽取性能。
  • 利用新颖的词级句子翻译规则,为未见关系生成高质量合成训练数据。
  • 基于知识图谱嵌入生成的加权虚拟标签,构建稳健的提示构造机制。
  • 通过结合数据增强、语义提示与原型网络分类,实现端到端的零样本关系三元组抽取。

提出的方法

  • 采用基于词级类比的句子翻译规则,从已见关系实例中生成包含未见关系的增强训练样本。
  • 利用知识图谱识别每个关系的语义相关词汇,并用于在提示模板中构建加权虚拟标签词。
  • 通过基于距离的去噪机制对虚拟标签词进行优化,根据与真实关系的语义相似度过滤无关或噪声词汇。
  • 使用加权虚拟标签而非真实关系标签构建提示,使模型能够泛化至未见关系。
  • 采用原型网络计算每类关系的原型嵌入,并利用查询句子嵌入与原型之间的欧氏距离进行分类。
  • 应用命名实体识别器提取实体类型,并根据提示模板中的超类约束对实体类型进行过滤与匹配,以匹配预测关系。

实验结果

研究问题

  • RQ1语义知识增强是否可通过为未见关系生成合成训练数据,从而提升零样本关系三元组抽取性能?
  • RQ2基于知识图谱的虚拟标签构建机制在降低噪声并提升对未见关系的泛化能力方面效果如何?
  • RQ3在提示模板中使用加权虚拟标签是否能带来优于直接使用真实标签的性能提升?
  • RQ4数据增强与语义提示的结合如何影响在多样化数据集上零样本关系三元组抽取的鲁棒性与准确性?
  • RQ5何种超参数设置能最优地平衡去噪阈值与虚拟标签数量,以在噪声数据与干净数据集中实现最大性能?

主要发现

  • ZS-SKA 在三个公开基准数据集——FewRel、Wiki-ZSL 和 NYT——的零样本关系三元组抽取设置下达到最先进性能。
  • 该模型超越了现有最先进方法,展现出在未见关系上卓越的泛化能力,且无需为这些关系提供任何标注训练数据。
  • 虚拟标签构建中的去噪机制能有效过滤知识图谱中无关词汇,提升提示质量与模型鲁棒性。
  • 在所有数据集中,阈值 τs 在 0.5 到 0.6 之间时性能最优,实现了噪声减少与语义覆盖之间的良好平衡。
  • 增加虚拟标签词数量(n)可提升性能,通过引入更多语义知识,使查询嵌入与关系原型之间的距离更短。
  • 在噪声较大的数据集(如 NYT)上,模型表现出更强的性能增益,表明去噪与知识融合组件在真实世界不完美数据场景中尤为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。