Skip to main content
QUICK REVIEW

[论文解读] Tackling Long-Tailed Relations and Uncommon Entities in Knowledge Graph Completion

Zihao Wang, Kwun Ping Lai|arXiv (Cornell University)|Sep 25, 2019
Advanced Graph Neural Networks被引用 8
一句话总结

本文提出了一种元学习框架,用于少样本知识图谱补全,通过利用文本描述,联合解决长尾关系和罕见实体问题。该框架引入了特定于关系的特征提取模块和变分自编码器用于三元组生成,在真实知识图谱(如DBPedia和Wikidata)中显著提升了对罕见关系和实体的性能表现。

ABSTRACT

For large-scale knowledge graphs (KGs), recent research has been focusing on the large proportion of infrequent relations which have been ignored by previous studies. For example few-shot learning paradigm for relations has been investigated. In this work, we further advocate that handling uncommon entities is inevitable when dealing with infrequent relations. Therefore, we propose a meta-learning framework that aims at handling infrequent relations with few-shot learning and uncommon entities by using textual descriptions. We design a novel model to better extract key information from textual descriptions. Besides, we also develop a novel generative model in our framework to enhance the performance by generating extra triplets during the training stage. Experiments are conducted on two datasets from real-world KGs, and the results show that our framework outperforms previous methods when dealing with infrequent relations and their accompanying uncommon entities.

研究动机与目标

  • 为解决先前研究中常被忽略的罕见关系和罕见实体的知识图谱补全挑战。
  • 将问题形式化为少样本学习任务,其中关系和实体均属罕见且数据稀缺。
  • 通过利用除结构信息外的文本描述,改进罕见实体的表征学习。
  • 通过生成式三元组模型进行数据增强,提升模型的泛化能力。
  • 开发一个统一框架,联合建模特定于关系的特征和实体描述,以实现更好的少样本泛化性能。

提出的方法

  • 一种新颖的描述编码器,能够从实体的文本描述中提取特定于关系的特征,即使实体参与多个关系也能有效处理。
  • 一种基于条件变分自编码器的三元组生成器(TCVAE),用于生成合成训练三元组,以缓解少样本设置下的数据稀疏问题。
  • 采用Reptile优化的元学习框架,学习一个可快速适应新未见关系和实体的初始化参数。
  • 联合训练描述编码器和三元组生成器,以提升表征质量与数据效率。
  • 将实体和关系的描述作为输入特征,并使用注意力机制聚焦于与每个关系相关的信息。
  • 在两个真实世界知识图谱(DBPedia和Wikidata)上进行评估,采用一 Shot 和四 Shot 设置以模拟罕见关系和实体的情景。

实验结果

研究问题

  • RQ1如何同时提升对长尾关系和罕见实体的知识图谱补全性能?
  • RQ2当实体参与多个关系时,能否有效从其描述中提取出特定于关系的信息?
  • RQ3通过合成三元组生成进行数据增强,是否能提升知识图谱补全中的少样本泛化能力?
  • RQ4元学习与基于描述的建模相结合,对罕见关系和实体的性能有何影响?
  • RQ5为提升性能而不导致过拟合,生成三元组的最优数量是多少?

主要发现

  • 在WDtext和DBPtext两个数据集上,该框架在单样本和四样本KGC设置下均优于所有基线模型。
  • 在DBPtext上,该框架在生成128个三元组时达到MRR为0.330,显著优于基线模型。
  • 在单样本设置下,该框架在WDtext上达到MRR为0.247,在DBPtext上达到MRR为0.304(生成64个三元组)。
  • 消融实验证实,特征提取模块和三元组生成均至关重要,移除任一模块均导致性能显著下降。
  • 最优三元组生成数量因数据集而异:WDtext为8个,DBPtext为128个,表明描述长度和复杂度会影响生成策略。
  • 该框架在较长、更复杂的描述(DBPtext)上表现优于较短描述(WDtext),表明对文本复杂性的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。