[论文解读] Probability Calibration for Knowledge Graph Embedding Models
本文提出了一种新颖的知识图谱嵌入模型校准方法,结合Platt缩放与等向回归,并使用合成生成的负样本,即使在缺乏真实负样本的情况下也能实现可靠的概率估计。实验表明,经校准的模型在三元组分类任务中达到最先进性能,且无需依赖关系特定的决策阈值。
Knowledge graph embedding research has overlooked the problem of probability calibration. We show popular embedding models are indeed uncalibrated. That means probability estimates associated to predicted triples are unreliable. We present a novel method to calibrate a model when ground truth negatives are not available, which is the usual case in knowledge graphs. We propose to use Platt scaling and isotonic regression alongside our method. Experiments on three datasets with ground truth negatives show our contribution leads to well-calibrated models when compared to the gold standard of using negatives. We get significantly better results than the uncalibrated models from all calibration methods. We show isotonic regression offers the best the performance overall, not without trade-offs. We also show that calibrated models reach state-of-the-art accuracy without the need to define relation-specific decision thresholds.
研究动机与目标
- 解决知识图谱嵌入模型中概率校准被忽视的问题,即预测概率无法准确反映真实置信度。
- 开发一种在缺乏真实负样本时仍能有效工作的校准方法,这在开放世界假设下的知识图谱中是典型情况。
- 为下游任务(如三元组分类)提供可靠的概率预测,而无需依赖关系特定的决策阈值。
- 在真实世界知识图谱数据集上,评估校准技术(Platt缩放与等向回归)在有无真实负样本情况下的性能表现。
- 证明经校准的模型在保持可信且可解释的概率估计的同时,实现最先进准确率。
提出的方法
- 使用Platt缩放与等向回归,通过将原始logits转换为校准后的概率,对模型输出进行校准。
- 提出一种启发式方法,在缺乏真实负样本时生成合成负样本,利用验证集中的正样本基础率作为依据。
- 在一半验证集上进行模型校准,将真实负样本替换为合成负样本,以维持校准性能。
- 在评估阶段采用封闭世界假设,将未见三元组视为负样本。
- 校准后对三元组分类使用单一阈值τ = 0.5,从而消除对每种关系特定阈值的需求。
- 使用可靠性图与期望校准误差(ECE)评估校准性能,与未经校准的基线模型及使用真实负样本的黄金标准校准方法进行对比。
实验结果
研究问题
- RQ1当真实负样本不可用(这在真实世界知识图谱中很常见)时,知识图谱嵌入模型能否被有效校准?
- RQ2在使用合成负样本采样时,Platt缩放与等向回归在知识图谱嵌入模型校准中的表现如何比较?
- RQ3校准是否能实现对所有关系使用单一通用决策阈值(τ = 0.5)进行三元组分类,从而消除对关系特定阈值的需求?
- RQ4校准在多大程度上提升了概率估计的可靠性,以期望校准误差与可靠性图衡量?
- RQ5经校准的模型是否能在无需额外模型调优或每种关系阈值学习的情况下,实现三元组分类的最先进性能?
主要发现
- 等向回归在所有数据集上均表现最佳,其期望校准误差显著优于Platt缩放与未经校准的模型。
- 即使仅使用一半验证集进行校准,且真实负样本被合成负样本替代,所提方法仍能实现良好的概率校准。
- 经校准的模型在WN11数据集上达到最先进准确率(88.9 F1),仅使用单一阈值τ = 0.5,性能与使用关系特定阈值的模型相当或更优。
- 未经校准的模型在τ = 0.5下表现欠佳,凸显了校准对可靠阈值划分的必要性。
- 该方法在三个数据集(WN11、FB13、YAGO39K)上,对四种评估模型(TransE、DistMult、ComplEx、HolE)均显著优于未经校准的基线模型。
- 可靠性图显示,未经校准的模型系统性地出现校准偏差——TransE存在低估现象,而ComplEx则根据损失函数不同,表现出不同程度的低估与高估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。