Skip to main content
QUICK REVIEW

[论文解读] Entity Type Prediction in Knowledge Graphs using Embeddings

Russa Biswas, Radina Sofronova|arXiv (Cornell University)|Apr 28, 2020
Advanced Graph Neural Networks参考文献 13被引用 4
一句话总结

本文提出了一种基于知识图谱嵌入的多标签分类方法,用于知识图谱中的细粒度实体类型预测,该嵌入结合了结构信息与文本信息。通过利用预训练词嵌入(Word2Vec、FastText、GloVe)和卷积神经网络(CNN)分类器,该方法在向量相似性基线上取得了更高的准确率,在每类4,000个实体的数据集上,Hits@3达到62%,证明了深度学习在丰富嵌入上的有效性。

ABSTRACT

Open Knowledge Graphs (such as DBpedia, Wikidata, YAGO) have been recognized as the backbone of diverse applications in the field of data mining and information retrieval. Hence, the completeness and correctness of the Knowledge Graphs (KGs) are vital. Most of these KGs are mostly created either via an automated information extraction from Wikipedia snapshots or information accumulation provided by the users or using heuristics. However, it has been observed that the type information of these KGs is often noisy, incomplete, and incorrect. To deal with this problem a multi-label classification approach is proposed in this work for entity typing using KG embeddings. We compare our approach with the current state-of-the-art type prediction method and report on experiments with the KGs.

研究动机与目标

  • 解决DBpedia等开放知识图谱中类型信息不完整和噪声的问题。
  • 通过整合知识图谱中的结构信息与隐含的文本语义信息,提升实体类型预测的准确性。
  • 评估不同预训练词嵌入模型(Word2Vec、FastText、GloVe)在实体类型预测背景下的表现。
  • 基于知识图谱嵌入,开发一种使用深度学习(CNN)的多标签分类框架,用于细粒度类型预测。

提出的方法

  • 通过将知识图谱三元组视为句子,并应用预训练词嵌入模型(Word2Vec、FastText、GloVe),学习实体和关系的向量表示。
  • 该模型将实体类型预测视为多标签分类问题,每个实体可被分配多个细粒度类型。
  • 使用卷积神经网络(CNN)对嵌入向量进行训练,以预测每个实体的正确类型集合。
  • 通过平均某一类别内所有实体的嵌入向量,利用集合论原理生成类别向量,以表示类别语义。
  • 将向量相似性作为基线方法,通过计算实体向量与类别向量之间的余弦相似度进行比较。
  • 该方法利用DBpedia的类别层次结构,从粗粒度到细粒度遍历类别,提取相关子类用于预测。

实验结果

研究问题

  • RQ1与传统基于相似性的方法相比,预训练词嵌入结合知识图谱结构是否能提升细粒度实体类型预测的性能?
  • RQ2在知识图谱的实体类型预测背景下,不同词嵌入模型(Word2Vec、FastText、GloVe)的表现如何?
  • RQ3对于同时预测多个实体类型的任务,深度学习模型(如CNN)是否优于简单的向量相似性方法?
  • RQ4数据集规模(每类实体数量)如何影响所提方法的性能?
  • RQ5所学习的嵌入在多大程度上捕捉了图结构之外的隐含文本语义?

主要发现

  • CNN模型表现最佳,在每类4,000个实体的数据集上,Hits@3达到62%,显著优于向量相似性基线方法。
  • 在包含86个类、每类2,000个实体的数据集中,使用Word2Vec的CNN模型达到58.4%的Hits@3,远超向量相似性基线的50.0% Hits@3。
  • 尽管GloVe向量的向量间相似性较低,但使用GloVe嵌入的CNN模型在最大数据集上仍达到55.8%的Hits@3,表明对嵌入质量具有鲁棒性。
  • 随着数据集规模增大,该方法性能提升,例如在每类4,000个实体的数据集上Hits@3达到58%,高于每类2,000个实体数据集的58%。
  • 使用Word2Vec的向量相似性基线在86类数据集上达到56%的Hits@3,表明其具有竞争力但仍逊于CNN方法。
  • 测试集中仅有26%至34%的实体与SDTyped数据集重叠,限制了直接比较;然而,在重叠子集上,所提方法在共享实体上表现优于SDTyped。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。