[论文解读] Realistic Re-evaluation of Knowledge Graph Completion Methods: An Experimental Study
本文通过识别并移除标准基准(如 FB15k、WN18 和 YAGO3-10)中的不切实际数据伪影——反向关系和重复关系,对知识图谱补全(KGC)方法进行了批判性再评估。研究发现,当此类冗余关系被移除后,最先进的嵌入模型(如 RotatE、TuckER)的准确率显著下降,表明以往的性能提升主要源于数据泄露而非真正的预测能力,从而挑战了现有 KGC 评估实践的有效性。
In the active research area of employing embedding models for knowledge graph completion, particularly for the task of link prediction, most prior studies used two benchmark datasets FB15k and WN18 in evaluating such models. Most triples in these and other datasets in such studies belong to reverse and duplicate relations which exhibit high data redundancy due to semantic duplication, correlation or data incompleteness. This is a case of excessive data leakage---a model is trained using features that otherwise would not be available when the model needs to be applied for real prediction. There are also Cartesian product relations for which every triple formed by the Cartesian product of applicable subjects and objects is a true fact. Link prediction on the aforementioned relations is easy and can be achieved with even better accuracy using straightforward rules instead of sophisticated embedding models. A more fundamental defect of these models is that the link prediction scenario, given such data, is non-existent in the real-world. This paper is the first systematic study with the main objective of assessing the true effectiveness of embedding models when the unrealistic triples are removed. Our experiment results show these models are much less accurate than what we used to perceive. Their poor accuracy renders link prediction a task without truly effective automated solution. Hence, we call for re-investigation of possible effective approaches.
研究动机与目标
- 调查数据冗余(特别是反向关系和重复关系)对知识图谱补全(KGC)模型性能的影响。
- 证明在 FB15k 和 WN18 等标准基准上取得的高性能主要源于数据泄露,而非模型的有效性。
- 通过移除不切实际的关系,提出并评估更真实的基准(如 FB15k-237、WN18RR、YAGO3-10-DR)。
- 挑战当前评估指标的有效性,这些指标会惩罚不在真实标签中的正确预测。
- 呼吁重新评估 KGC 方法,认为在真实条件下,链接预测缺乏真正有效的自动化解决方案。
提出的方法
- 作者系统性地识别并从 FB15k 和 WN18 中移除反向三元组(例如 (h,r,t) 和 (t,r⁻¹,h)),创建了新基准:FB15k-237 和 WN18RR。
- 他们还识别并移除了重复关系(例如 YAGO3-10 中的 isAffiliatedTo 和 playsFor),创建 YAGO3-10-DR 以消除类似笛卡尔积的冗余。
- 该研究使用标准指标(如 FHits@1 和 FMRR)在原始基准和清理后的基准上评估了多种 KGC 模型(如 TransE、RotatE、TuckER、AMIE)。
- 基于反向三元组统计构建了一个简单的基于规则的模型,以检验基本统计是否能超越复杂嵌入模型。
- 评估包括按关系类型(1对1、1对多、多对1、多对多)进行的消融研究,以分析模型在不同关系模式下的行为。
- 作者对比了不同数据集和指标下的性能,突出显示了标准评估与真实评估之间的差异。
实验结果
研究问题
- RQ1FB15k 和 WN18 中的反向关系在多大程度上夸大了 KGC 模型的性能?
- RQ2在反向三元组密度较高的数据集中,简单的基于规则的模型是否能超越复杂嵌入模型?
- RQ3当从标准基准中移除不切实际的关系时,FHits@1 和 FMRR 等性能指标如何变化?
- RQ4嵌入模型在 FB15k-237 和 WN18RR 等真实、清理后的数据集上是否仍保持有效性?
- RQ5由于反向和重复关系导致的数据泄露,当前的评估实践是否具有误导性?
主要发现
- FB15k 的训练集和测试集中有 70% 的三元组构成反向对,WN18 测试集中 92.5% 的三元组在训练集中存在对应的反向三元组,表明存在巨大的数据冗余。
- 一个简单的基于规则的模型在 FB15k 上实现了 71.6% 的 FHits@1,在 WN18 上实现了 96.4%,由于依赖反向三元组统计,其表现优于复杂嵌入模型。
- 在移除反向和重复关系后,所有嵌入模型在 FB15k-237 和 WN18RR 上的性能均显著下降,其中 RotatE 和 TuckER 表现最佳。
- 在 YAGO3-10-DR 上,该数据集移除了重复关系,AMIE 在 FHits@1 和 FMRR 上均优于嵌入模型,表明基于规则的方法在真实数据上可能更有效。
- 研究显示,当正确预测未包含在真实标签中时,FHits@1 和 FMRR 指标具有误导性,因为它们会惩罚正确但未被观测到的事实。
- 综合结果表明,当前的 KGC 模型在真实条件下并不具备鲁棒性,当移除数据伪影后,链接预测在缺乏真正有效自动化解决方案的情况下难以实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。