[论文解读] A Re-evaluation of Knowledge Graph Completion Methods
本文指出,近期基于神经网络的知识图谱补全(KGC)方法因存在缺陷的评估协议而报告了被夸大的性能表现,这些协议倾向于偏好具有偏差得分函数的模型。作者提出一种稳健的“Random”评估协议——即在得分相等时随机打破平局——以确保公平、一致且真实的性能比较,证明此前某些模型报告的显著性能提升在该协议下已不复存在。
Knowledge Graph Completion (KGC) aims at automatically predicting missing links for large-scale knowledge graphs. A vast number of state-of-the-art KGC techniques have got published at top conferences in several research fields, including data mining, machine learning, and natural language processing. However, we notice that several recent papers report very high performance, which largely outperforms previous state-of-the-art methods. In this paper, we find that this can be attributed to the inappropriate evaluation protocol used by them and propose a simple evaluation protocol to address this problem. The proposed protocol is robust to handle bias in the model, which can substantially affect the final results. We conduct extensive experiments and report the performance of several existing methods using our protocol. The reproducible code has been made publicly available
研究动机与目标
- 调查为何近期基于神经网络的KGC方法在基准数据集上报告了异常高的性能提升。
- 识别出根本原因在于评估协议存在缺陷,导致偏好具有偏差得分函数的模型。
- 提出一种新评估协议,可公平比较不同复杂度或偏差程度的得分函数模型。
- 使用所提出的协议重新评估最先进KGC方法,揭示先前结果中性能被高估的现象。
- 推动采用Random评估协议作为KGC基准测试的新标准,以实现公平且可靠的评估。
提出的方法
- 提出一种名为“Random”的新评估协议,其中在得分相等时随机打破平局,以确保公平性和真实性。
- 引入两种替代协议——“Top”和“Bottom”——以展示现有评估方法中的偏差。
- 将“Random”协议作为黄金标准,因其更贴近现实世界中平局预测被随机解决的情境。
- 使用新协议在FB15k-237和WN18RR上重新评估6种近期KGC方法(ConvKB、CapsE、KBAT、TransGate、RotatE、TuckER、ConvE)。
- 修复KBAT原始实现中的数据泄露问题,以确保比较的有效性。
- 每种模型运行5次不同随机种子的实验,以评估稳定性,并报告均值±标准差以增强结果的稳健性。
实验结果
研究问题
- RQ1为何一些新提出的基于神经网络的KGC方法报告的性能远超以往最先进方法?
- RQ2报告的性能提升在多大程度上源于评估协议的缺陷,而非模型本身的改进?
- RQ3不同评估协议(Top、Bottom、Random)如何影响KGC模型的性能排名?
- RQ4能否设计一种既公平又对得分函数偏差具有鲁棒性的新评估协议?
- RQ5此前报告的CapsE和KBAT等模型的高性能提升,在公平评估协议下是否依然成立?
主要发现
- Top评估协议人为地提高了具有偏差得分函数模型的性能,使其获得不公平的优势。
- Bottom评估协议不公平地惩罚了产生平局得分的模型,导致性能估计过于悲观。
- 在所提出的Random评估协议下,CapsE在FB15k-237上的MRR从0.523降至0.421,表明先前结果存在显著性能高估。
- KBAT在FB15k-237上的性能在Random协议下从0.518降至0.401,且原始实现中的数据泄露进一步扭曲了结果。
- 未受影响的模型如ConvE、RotatE和TuckER在所有协议下表现一致,证实其稳健性。
- Random协议在多个随机种子下表现稳定,方差极低(例如MRR±0.005),证实其适用于基准测试的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。