Skip to main content
QUICK REVIEW

[论文解读] On Evaluating Embedding Models for Knowledge Base Completion

Yanjie Wang, Daniel Ruffinelli|arXiv (Cornell University)|Oct 17, 2018
Topic Modeling参考文献 32被引用 5
一句话总结

本文挑战了知识库补全(KBC)嵌入模型的标准评估协议,认为实体排序(ER)更偏向于问答任务而非以精度为核心的KBC。本文提出实体对排序(PR),评估模型对所有可能的(主语,关系,宾语)三元组——包括无意义三元组——的排序能力,结果表明当前模型在PR下表现极差,尤其与简单的基于规则的基线相比,凸显出对更优模型与评估方法的迫切需求。

ABSTRACT

Knowledge bases contribute to many web search and mining tasks, yet they are often incomplete. To add missing facts to a given knowledge base, various embedding models have been proposed in the recent literature. Perhaps surprisingly, relatively simple models with limited expressiveness often performed remarkably well under today's most commonly used evaluation protocols. In this paper, we explore whether recent models work well for knowledge base completion and argue that the current evaluation protocols are more suited for question answering rather than knowledge base completion. We show that when focusing on a different prediction task for evaluating knowledge base completion, the performance of current embedding models is unsatisfactory even on datasets previously thought to be too easy. This is especially true when embedding models are compared against a simple rule-based baseline. This work indicates the need for more research into the embedding models and evaluation protocols for knowledge base completion.

研究动机与目标

  • 调查在标准评估协议下表现良好的情况下,当前知识库嵌入模型是否真正有效于知识库补全(KBC)任务。
  • 挑战实体排序(ER)作为KBC评估协议的假设,认为其更契合问答任务,而非KBC追求高精度补全的目标。
  • 提出并评估一种新评估协议——实体对排序(PR),通过在排序中包含所有可能的实体对(包括无意义三元组)来更好地反映KBC对高精度的需求。
  • 在新PR协议下,将最先进嵌入模型与简单基于规则的基线进行性能比较,揭示模型在可靠性方面的显著缺陷。
  • 评估类型约束对模型预测的影响,并检验过滤类型错误三元组是否能提升性能,从而判断模型捕捉关系结构的能力。

提出的方法

  • 提出一种名为实体对排序(PR)的新评估协议,其中对于每个关系k,所有可能的(主语,关系,宾语)三元组均被排序,包括无意义三元组如(乌尔姆,出生地,爱因斯坦)。
  • 使用标准KBC数据集(FB15K、FB-237、YAGO3-10),并评估多种嵌入模型:DistMult、TransE、ComplEx、Analogy、RESCAL,以及一个基于规则的模型(RuleN)。
  • 在标准实体排序(ER)和所提出的PR协议下评估模型,以比较不同评估目标下的性能表现。
  • 通过移除违反Freebase中领域与范围类型约束的预测结果,实施类型过滤,以评估模型预测错误类型三元组的数量及其对性能的改善程度。
  • 使用标准指标(Hits@K 与 MAP@K,K=100)衡量性能,以评估两种协议下的排序质量。
  • 开展消融研究,分析低估效应以及类型过滤对模型排序和计算成本的影响。

实验结果

研究问题

  • RQ1标准实体排序(ER)评估协议是否准确反映了嵌入模型在知识库补全(KBC)任务中的真实性能,还是其对问答任务存在偏差?
  • RQ2在强调精度的新评估协议——实体对排序(PR)下,最先进嵌入模型的表现如何?该协议通过包含所有可能的实体对(包括无意义三元组)来实现。
  • RQ3嵌入模型在多大程度上为错误或无意义三元组分配高分,这如何影响其在真实世界知识库补全任务中的可靠性?
  • RQ4在更严格的评估协议(如PR)下,简单基于规则的基线是否能超越复杂嵌入模型?这反映了当前模型设计的何种问题?
  • RQ5类型约束在多大程度上影响模型预测?过滤类型错误的预测是否能显著提升模型性能与计算效率?

主要发现

  • 在实体对排序(PR)协议下,所有嵌入模型的表现均显著劣于基于规则的基线RuleN,后者在FB15K上达到77.4% Hits@100,在FB-237上达到7.6%,表明当前模型难以维持高精度。
  • 所有嵌入模型在类型过滤后性能均得到提升,表明其常预测错误类型(如领域或范围)的三元组——例如,DistMult在FB15K上的Hits@100得分在过滤后提升了17.5个百分点。
  • 在更复杂的FB-237数据集上,所有嵌入模型在类型过滤后表现趋于一致,表明当施加精度约束时,模型间的差异显著减小。
  • 标准实体排序(ER)协议可能具有误导性,因为它仅在‘合理’问题上评估模型,排除了无意义三元组,因此未能惩罚那些为虚假事实分配高分的模型。
  • 尽管结构更简单,RuleN在所有关系上均接近完美表现,凸显出当精度被优先考虑时,基于规则的系统可超越复杂嵌入模型。
  • 类型过滤将平均评估时间减少至原始时间的约30%,表明融入背景知识不仅能提升可靠性,还能增强效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。