Skip to main content
QUICK REVIEW

[论文解读] Representation Learning of Entities and Documents from Knowledge Base Descriptions

Ikuya Yamada, Hiroyuki Shindo|arXiv (Cornell University)|Jun 7, 2018
Topic Modeling参考文献 29被引用 13
一句话总结

TextEnt 是一种神经网络模型,通过在基于维基百科的知识库文档上进行训练以预测目标实体,从而学习实体与文档的联合分布式表示。通过在共享向量空间中联合嵌入词和实体,它在细粒度实体类型分类和多类文本分类任务上实现了最先进性能,通过有效整合来自文本和实体的语义信号,超越了先前的方法。

ABSTRACT

In this paper, we describe TextEnt, a neural network model that learns distributed representations of entities and documents directly from a knowledge base (KB). Given a document in a KB consisting of words and entity annotations, we train our model to predict the entity that the document describes and map the document and its target entity close to each other in a continuous vector space. Our model is trained using a large number of documents extracted from Wikipedia. The performance of the proposed model is evaluated using two tasks, namely fine-grained entity typing and multiclass text classification. The results demonstrate that our model achieves state-of-the-art performance on both tasks. The code and the trained representations are made available online for further academic research.

研究动机与目标

  • 开发一种直接从知识库描述中学习实体与文档联合分布式表示的方法。
  • 通过结合唯一标识的实体与词级语义,解决自然语言中的歧义和词汇变体问题。
  • 在细粒度实体类型分类和多类文本分类任务上评估所学表示的质量。
  • 通过实体感知表示实现通用文档编码,以支持下游自然语言处理任务。
  • 发布代码和预训练表示,以支持进一步的学术研究。

提出的方法

  • 该模型使用神经网络架构,处理包含词和上下文实体标注的文档,以预测所描述的目标实体。
  • 通过词嵌入和上下文实体嵌入的平均池化计算文档表示,每种表示维度为 d。
  • 使用 softmax 分类器基于文档表示与实体嵌入向量之间的点积,计算每个实体为目标的概率。
  • 模型在大规模维基百科文档上端到端训练,通过反向传播更新参数,以最小化交叉熵损失。
  • 在测试文档中,实体提及通过外部实体链接系统自动标注,之后使用与训练时相同的方法进行编码。
  • 最终的文档表示通过组合基于词和基于实体的表示形成,实现对语义信号的联合建模。

实验结果

研究问题

  • RQ1能否通过从知识库描述中联合学习实体与文档表示,提升下游自然语言处理任务的性能?
  • RQ2实体感知表示在多大程度上能有效解决文本中的词汇歧义和同义现象?
  • RQ3与仅使用词的模型相比,实体信息的整合是否能提升细粒度实体类型分类的性能?
  • RQ4所学表示能否作为多类文本分类任务中的强大通用编码器?
  • RQ5与仅依赖词级嵌入相比,基于实体的信号在多大程度上增强了语义表示?

主要发现

  • TextEnt 在细粒度实体类型分类任务上实现了最先进性能,显著优于现有方法。
  • 在 20 Newsgroups 和 R8 文本分类数据集上,TextEnt 超过了强基线模型,证明其作为通用文档编码器的有效性。
  • 该模型能够将句子编码为向量空间,使得向量空间中最近的实体与句子内容在语义上高度相关,如定性示例所示。
  • 同时使用词和实体信号可获得更鲁棒且更少歧义的表示,尤其在处理多义性和词汇变体方面表现更优。
  • 已公开训练好的模型和代码,支持可复现性以及在实体感知表示学习领域的进一步研究。
  • 与 Wikipedia2Vec 及其他基线模型相比,TextEnt 在两项评估任务中均表现出更优性能,验证了其联合预测设计选择的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。