Skip to main content
QUICK REVIEW

[论文解读] Learning Embedding Representations for Knowledge Inference on Imperfect and Incomplete Repositories

Miao Fan, Qiang Zhou|arXiv (Cornell University)|Mar 27, 2015
Topic Modeling参考文献 17被引用 3
一句话总结

本文提出 IIKE,一种概率知识嵌入模型,可在 Freebase 和 NELL 等不完整、不完美的知识库中学习实体和关系的低维向量表示。通过最小化来自机器学习(NELL)和众包(Freebase)的置信度损失,IIKE 改进了链接预测和三元组分类,分别在 FB15K 和 NELL 上达到 91.1% 和 91.4% 的准确率,性能达到当前最先进水平。

ABSTRACT

This paper considers the problem of knowledge inference on large-scale imperfect repositories with incomplete coverage by means of embedding entities and relations at the first attempt. We propose IIKE (Imperfect and Incomplete Knowledge Embedding), a probabilistic model which measures the probability of each belief, i.e. $\langle h,r,t angle$, in large-scale knowledge bases such as NELL and Freebase, and our objective is to learn a better low-dimensional vector representation for each entity ($h$ and $t$) and relation ($r$) in the process of minimizing the loss of fitting the corresponding confidence given by machine learning (NELL) or crowdsouring (Freebase), so that we can use $||{\bf h} + {\bf r} - {\bf t}||$ to assess the plausibility of a belief when conducting inference. We use subsets of those inexact knowledge bases to train our model and test the performances of link prediction and triplet classification on ground truth beliefs, respectively. The results of extensive experiments show that IIKE achieves significant improvement compared with the baseline and state-of-the-art approaches.

研究动机与目标

  • 解决大规模、不完美且不完整的知识库(如 Freebase 和 NELL)中的知识推理挑战。
  • 克服现有方法依赖完整、真实标签训练数据或需要外部文本源的局限性。
  • 开发一种统一的概率嵌入模型,无需关系特定规则即可学习全局连接模式。
  • 通过向量相似性建模信念合理性,实现对不完整知识库的有效推理。
  • 仅使用不精确、不完整的训练数据,提升链接预测与三元组分类的性能。

提出的方法

  • 提出 IIKE,一种概率模型,基于实体和关系嵌入的打分函数,估计三元组 ⟨h, r, t⟩ 的合理性。
  • 使用损失函数,最小化预测置信度与来自 NELL(机器学习)或 Freebase(众包)的实际置信度之间的差异。
  • 在随机梯度下降(SGD)过程中通过负采样高效训练模型,采样虚假三元组。
  • 学习实体(h, t)和关系(r)的低维向量表示,使得 ||h + r - t|| 衡量三元组的合理性。
  • 使用 SGD 优化嵌入表示,超参数包括 d(嵌入维度)、α(学习率)、b(边界值)和 norm(L1 或 L2 范数)。
  • 使用关系特定的阈值 σr,通过验证集优化确定,用于在三元组分类中将三元组分类为正例或负例。

实验结果

研究问题

  • RQ1概率嵌入模型能否在不依赖真实标签训练数据的情况下,有效从不完整、不完美的知识库中学习?
  • RQ2当在 NELL 和 Freebase 的不精确信念数据上进行训练时,IIKE 在链接预测与三元组分类中的表现如何?
  • RQ3基于 NELL 和 Freebase 的置信度分数进行学习,是否能带来优于基于真实标签数据训练的模型的泛化能力?
  • RQ4是否可以在不依赖关系特定规则归纳的前提下,在统一的嵌入空间中有效捕捉全局连接模式?
  • RQ5与 TransE、TransH 和 NTN 等当前最先进模型相比,IIKE 在准确率与判别能力方面表现如何?

主要发现

  • 在 FB15K 三元组分类基准上,IIKE 达到 91.1% 的准确率,显著优于 TransH(80.2%)、TransE(79.7%)和 NTN(66.7%)。
  • 在 NELL 数据集上,IIKE 达到 91.4% 的准确率,超越 TransH(89.1%)和 TransE(82.4%)的三元组分类性能。
  • IIKE 的精确率-召回率曲线显示其 AUC 值大于 TransH 和 TransE,表明其具备更优的全局判别能力。
  • IIKE 在链接预测任务中表现出强大的泛化能力,在 FB15K 和 NELL 上均优于基线方法与当前最先进方法。
  • 利用来自 NELL 和 Freebase 的置信度分数作为监督信号,使模型即使在不完整且噪声较多的知识库上也能实现有效学习。
  • 该模型在两个特性不同的知识库上均得到验证,证实其鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。