Skip to main content
QUICK REVIEW

[论文解读] A Unified Framework for Rank-based Evaluation Metrics for Link Prediction in Knowledge Graphs

Charles Tapley Hoyt, Max Berrendorf|arXiv (Cornell University)|Mar 14, 2022
Advanced Graph Neural Networks被引用 8
一句话总结

本文提出了一套统一的理论框架,用于知识图谱链接预测中的基于排名的评估指标,引入了改进的指标如调整后的MRR(AMRR)和z-score化指标(ZMRR),以提升不同规模数据集之间的可解释性和可比性。通过利用广义均值和概率校正,作者证明了传统指标如MRR会受到数据集大小的影响而产生偏差,而他们提出的新型指标则揭示了模型和知识图谱之间更准确、更显著的性能差异。

ABSTRACT

The link prediction task on knowledge graphs without explicit negative triples in the training data motivates the usage of rank-based metrics. Here, we review existing rank-based metrics and propose desiderata for improved metrics to address lack of interpretability and comparability of existing metrics to datasets of different sizes and properties. We introduce a simple theoretical framework for rank-based metrics upon which we investigate two avenues for improvements to existing metrics via alternative aggregation functions and concepts from probability theory. We finally propose several new rank-based metrics that are more easily interpreted and compared accompanied by a demonstration of their usage in a benchmarking of knowledge graph embedding models.

研究动机与目标

  • 解决现有基于排名的评估指标在知识图谱链接预测中缺乏可解释性和可比性的问题。
  • 为基于排名的指标建立理论基础,以实现系统性分析与改进。
  • 提出新型指标(如AMRR、ZMRR和HMR),这些指标对数据集大小具有不变性,能更可靠地反映模型性能。
  • 实现在不同大小和特性的数据集之间对知识图谱嵌入模型(KGEMs)的公平基准测试。
  • 在PyKEEN中提供新指标的开源实现,以支持可复现的评估。

提出的方法

  • 基于广义幂均值提出理论框架,以统一和分析基于排名的评估指标。
  • 引入替代聚合函数,如调和平均排名(HMR)、几何平均排名(GMR)和倒数平均排名(IMR),以提升鲁棒性。
  • 应用排名变换(如倒数和几何均值)以降低对极端值的敏感性,并提升可解释性。
  • 通过在随机排名下的期望值和方差推导概率校正(如AMRR、ZMRR),以在不同数据集之间标准化指标。
  • 采用z-score标准化,通过将性能与随机情况下的期望值进行对比,实现对不同知识图谱的指标值进行直接比较。
  • 在PyKEEN v1.8.0中实现所有新指标,并在可能的情况下提供期望值和方差的闭式解。

实验结果

研究问题

  • RQ1如何使知识图谱链接预测中基于排名的评估指标在不同规模的数据集之间更具可解释性和可比性?
  • RQ2现有指标(如MRR和HK)具有哪些理论特性?它们在数据集规模变化时如何失效?
  • RQ3替代聚合函数(如调和均值、几何均值、倒数均值)能否产生更鲁棒且更有意义的评估分数?
  • RQ4概率校正(如z-score、调整均值)在多大程度上提升了模型比较中的公平性和显著性?
  • RQ5新指标如何揭示出传统指标(如MRR)所掩盖的性能差异?

主要发现

  • 传统MRR与数据集大小表现出强烈的负相关性,表明其存在偏差,无法在不同知识图谱之间进行可比性比较。
  • 调整后的MRR(AMRR)和z-score化MRR(ZMRR)指标消除了大小偏差,实现了在不同数据集之间对模型性能的更公平比较。
  • 在Nations数据集上,ComplEx的MRR表现与其它模型相当,但AMRR和ZMRR显示其在与WN18-RR对比时表现显著落后。
  • TuckER在Nations数据集上的MRR表现更优,但AMRR和ZMRR表明其在更大的WN18-RR数据集上实际性能更佳。
  • z-score化指标显示,较小数据集(Kinships、Nations)上获得的高MRR分数在统计上显著性低于较大数据集(WN18-RR、FB15k-237)上的分数。
  • 新指标已在PyKEEN v1.8.0中提供,并支持期望值和方差的闭式解,实现了高效且标准化的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。