Skip to main content
QUICK REVIEW

[论文解读] GreenKGC: A Lightweight Knowledge Graph Completion Method

Yun-Cheng Wang, Xiou Ge|arXiv (Cornell University)|Aug 19, 2022
Advanced Graph Neural Networks被引用 4
一句话总结

GreenKGC 提出了一种轻量级、模块化的知识图谱补全方法,通过结合表征学习、判别性特征剪枝和关系分组分类器训练,在低维嵌入(8–32D)中实现了最先进性能。该方法在低维设置下优于当前最先进(SOTA)方法,并在显著更小的模型尺寸下匹配或超越高维模型,从而实现资源受限平台上的高效部署。

ABSTRACT

Knowledge graph completion (KGC) aims to discover missing relationships between entities in knowledge graphs (KGs). Most prior KGC work focuses on learning embeddings for entities and relations through a simple scoring function. Yet, a higher-dimensional embedding space is usually required for a better reasoning capability, which leads to a larger model size and hinders applicability to real-world problems (e.g., large-scale KGs or mobile/edge computing). A lightweight modularized KGC solution, called GreenKGC, is proposed in this work to address this issue. GreenKGC consists of three modules: representation learning, feature pruning, and decision learning, to extract discriminant KG features and make accurate predictions on missing relationships using classifiers and negative sampling. Experimental results demonstrate that, in low dimensions, GreenKGC can outperform SOTA methods in most datasets. In addition, low-dimensional GreenKGC can achieve competitive or even better performance against high-dimensional models with a much smaller model size.

研究动机与目标

  • 解决知识图谱补全(KGC)中因推理所需高维嵌入而导致模型尺寸过大的挑战。
  • 实现在移动和边缘设备等资源受限平台上的高效、准确的KGC。
  • 开发一种模块化、参数高效的框架,即使在低维空间中也能保持高性能。
  • 通过避免端到端深度神经网络训练,减少训练时间及对复杂初始化的依赖。
  • 通过针对知识图谱结构和嵌入行为量身定制的新颖负采样策略,提升泛化能力和鲁棒性。

提出的方法

  • 在模块1中使用预训练的KGE模型(例如,TransE)作为高维实体和关系表征的基线。
  • 在模块2中应用特征剪枝过程,从高维嵌入中选择具有判别性的维度,降低维度的同时保留预测能力。
  • 将具有相似判别特征维度的关系分组,以共享分类器参数并提升效率。
  • 在模块3中为每组关系训练一个二分类器,使用软标签预测三元组存在的概率(0到1之间)。
  • 引入两种新颖的负采样方案:基于本体的和基于嵌入的,用于困难负样本挖掘,以提升分类器的泛化能力。
  • 独立训练每个模块,支持模块化优化并降低训练复杂度。

实验结果

研究问题

  • RQ1一种轻量级KGC方法是否能在不依赖高维表征的情况下,在低维嵌入中实现具有竞争力的性能?
  • RQ2模块化特征剪枝与关系分组如何影响低维KGC中的模型效率与性能?
  • RQ3基于本体和基于嵌入的负采样是否相比随机采样能更好地提升分类器学习效果?
  • RQ4GreenKGC在推理速度和模型尺寸方面与SOTA KGE及基于神经网络的KGC方法相比如何?
  • RQ5GreenKGC所采用的模块化、解耦式训练方法是否能避免端到端深度学习模型中常见的收敛与优化问题?

主要发现

  • GreenKGC在FB15k-237和WN18RR数据集上,于8、16、32维设置下实现了SOTA性能,优于现有低维KGC方法。
  • 在32维设置下,GreenKGC在FB15k-237上的MRR达到0.316,在WN18RR上达到0.411,超越基线KGE及其他低维模型。
  • GreenKGC在32维设置下的性能与高维KGE模型(如128D)相当或更优,但参数量显著更少。
  • 与知识蒸馏方法(如DualDE)相比,GreenKGC在大规模数据集(如YAGO3-10)上的训练时间减少了约20倍。
  • 在FB15k-237上,基于本体的负采样策略优于随机采样和基于嵌入的采样;而在基于概念的知识图谱(如WN18RR)上,基于嵌入的采样更有效。
  • GreenKGC的预测得分分布反映了知识图谱的稀疏性,仅有少数高分候选接近1,表明其具备鲁棒性与真实的置信度估计能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。