Skip to main content
QUICK REVIEW

[论文解读] Knowledge Graph Representation with Jointly Structural and Textual Encoding

Jiacheng Xu, Kan Chen|arXiv (Cornell University)|Nov 26, 2016
Advanced Graph Neural Networks参考文献 20被引用 16
一句话总结

该论文提出了一种深度学习框架,通过门控融合机制和基于注意力的LSTM对知识图谱中的结构化信息与文本信息进行联合编码。该模型在链接预测和三元组分类任务上优于当前最先进方法,在WN18上达到97.8%的准确率,在FB15K上达到91.5%,通过动态平衡结构与文本信号,显著提升了稀疏实体的性能表现。

ABSTRACT

The objective of knowledge graph embedding is to encode both entities and relations of knowledge graphs into continuous low-dimensional vector spaces. Previously, most works focused on symbolic representation of knowledge graph with structure information, which can not handle new entities or entities with few facts well. In this paper, we propose a novel deep architecture to utilize both structural and textual information of entities. Specifically, we introduce three neural models to encode the valuable information from text description of entity, among which an attentive model can select related information as needed. Then, a gating mechanism is applied to integrate representations of structure and text into a unified architecture. Experiments show that our models outperform baseline by margin on link prediction and triplet classification tasks. Source codes of this paper will be available on Github.

研究动机与目标

  • 解决知识图谱中低频或稀疏实体因缺乏足够结构事实而难以表征的挑战。
  • 将实体的结构化与文本化表征整合到一个统一且自适应的向量空间中。
  • 设计一种机制,根据实体频率与关系上下文动态平衡结构与文本信息的贡献。
  • 通过利用丰富的文本描述提升知识图谱补全任务性能,同时保持语义一致性。

提出的方法

  • 使用门控融合机制结合来自TransE的结构嵌入与文本嵌入,学习结构与文本两种来源之间的动态平衡。
  • 采用基于注意力的LSTM编码器,从实体描述中选择性提取与关系相关的特征,提升信息的相关性与上下文感知能力。
  • 采用连续词袋模型(CBOW)与卷积神经网络(CNN)作为基线文本编码方法,并引入改进的注意力-LSTM变体以实现更优的上下文建模。
  • 基于TransE定义得分函数,最终实体表征为通过可学习门控加权的结构与文本嵌入之和。
  • 采用联合损失函数端到端训练模型,同时优化链接预测与三元组分类任务。
  • 针对每种关系采用基于阈值的分类策略,评估三元组分类性能。

实验结果

研究问题

  • RQ1联合学习结构化与文本化表征是否能提升稀疏实体的知识图谱嵌入性能?
  • RQ2神经网络模型如何根据实体频率与关系上下文动态平衡结构与文本信息?
  • RQ3基于注意力机制的选择性提取与关系相关的文本内容,是否优于固定编码方法?
  • RQ4门控融合机制是否能超越固定权重或独立优化策略,在结合结构与文本信号方面表现更优?

主要发现

  • 所提出的模型,特别是'Jointly(A-LSTM)',在WN18三元组分类基准上达到97.8%的准确率,显著优于基线方法与当前最先进方法。
  • 在更大的FB15K数据集上,该模型在三元组分类任务中达到91.5%的准确率,相较于现有方法有显著提升。
  • 门控机制对低频实体赋予更高的文本表征权重,证实其在缓解知识库稀疏性方面的有效性。
  • 注意力机制在FB15K上提升了性能,表明其在关系数量庞大、关系类型多样的复杂上下文中具有重要价值。
  • 该模型在所有指标上均持续优于基线方法,证明了自适应门控机制下联合编码的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。