[论文解读] On the Ambiguity of Rank-Based Evaluation of Entity Alignment or Link Prediction Methods
本文揭示了知识图谱中基于排名的评估方法在实体对齐与链接预测任务中的关键缺陷,表明标准指标如平均排名(MR)和Hits@K受测试集大小影响而产生偏差,无法实现跨数据集的公平比较。作者提出修正平均排名指数(AMRI),一种通过校正随机性能实现归一化的评分方法。实证评估表明,AMRI能够在不同数据集和测试规模下实现一致、可解释且可比较的模型评估。
In this work, we take a closer look at the evaluation of two families of methods for enriching information from knowledge graphs: Link Prediction and Entity Alignment. In the current experimental setting, multiple different scores are employed to assess different aspects of model performance. We analyze the informativeness of these evaluation measures and identify several shortcomings. In particular, we demonstrate that all existing scores can hardly be used to compare results across different datasets. Moreover, we demonstrate that varying size of the test size automatically has impact on the performance of the same model based on commonly used metrics for the Entity Alignment task. We show that this leads to various problems in the interpretation of results, which may support misleading conclusions. Therefore, we propose adjustments to the evaluation and demonstrate empirically how this supports a fair, comparable, and interpretable assessment of model performance. Our code is available at https://github.com/mberr/rank-based-evaluation.
研究动机与目标
- 识别知识图谱中实体对齐(EA)与链接预测(LP)任务当前基于排名评估协议的根本缺陷。
- 证明标准指标如平均排名(MR)和Hits@K对测试集大小敏感,导致性能比较产生误导。
- 表明现有评估分数无法为不同数据集或训练策略下的模型比较提供一致基准。
- 提出一种改进的评估指标——修正平均排名指数(AMRI),通过校正随机性能实现更公平、更具可解释性的比较。
- 通过实证验证,AMRI在不同测试集规模和数据集上均能产生稳定、一致且有意义的模型性能评估。
提出的方法
- 提出一种新型评估指标——修正平均排名指数(AMRI),通过考虑随机分配下的期望排名来归一化排名得分。
- 将随机分配下的期望排名定义为候选实体数量的函数,并根据数据集特性进行调整。
- 在实体对齐与链接预测任务中应用AMRI指标,采用过滤评估协议以确保与标准基线的一致性。
- 在不同规模的训练数据上训练模型(如GCN-Align),并在不同大小的测试集上评估其性能,以检验指标的稳定性。
- 使用统计验证方法(如Spearman等级相关系数)分析节点度与嵌入相似性之间的关系,支持模型偏差的假设。
- 在多个数据集(WN18RR、FB15k-237)和模型(DistMult、ConvE、TransE等)上,将AMRI与标准指标(MR、Hits@K)进行对比,验证其鲁棒性与可解释性。
实验结果
研究问题
- RQ1为何标准基于排名的评估指标(如平均排名与Hits@K)在跨不同数据集或测试集大小比较模型时,会产生不一致且误导的结果?
- RQ2测试集大小如何影响同一模型在实体对齐与链接预测任务中标准评估指标下的性能表现?
- RQ3现有评估指标在多大程度上未能考虑随机性能,从而导致结果偏差或不可比?
- RQ4能否设计一种归一化评估指标,以校正因测试集大小与候选集大小变化而引入的偏差?
- RQ5所提出的AMRI指标在知识图谱补全与对齐任务中,如何提升模型比较的可解释性与公平性?
主要发现
- 标准指标如平均排名(MR)和Hits@1随测试集大小增加而显著上升,甚至在模型不变时也呈现近乎线性增长,表明评估中存在根本性偏差。
- Hits@1指标同样对测试集大小敏感,表现为随着测试集增大,性能看似下降——即使模型实际预测能力保持不变。
- 所提出的修正平均排名指数(AMRI)几乎不受测试集大小影响,在不同评估配置下保持稳定得分,从而实现更公平的比较。
- 在DBP15k(JAPE)数据集上,即使训练时使用0个对齐样本,模型的AMRI仍约为-0.0025%,表明GCN-Align中的消息传递机制引入了基于度的归纳偏差,可在无监督条件下提升性能。
- 节点度与嵌入范数之间存在显著负相关性(ρ ≈ -0.041,p ≈ 9.22×10⁻¹⁷),表明高阶数节点更相似,这解释了GCN-Align中的归纳偏差来源。
- 在跨数据集比较中,AMRI揭示出模型在WN18RR上的表现系统性差于FB15k-237,这一差异不仅源于数据集规模,更可能与稀疏性或关系复杂性有关,而标准指标则掩盖了这一现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。