Skip to main content
QUICK REVIEW

[论文解读] ESA: Entity Summarization with Attention

Dongjun Wei, Yaxin Liu|arXiv (Cornell University)|May 25, 2019
Topic Modeling参考文献 28被引用 5
一句话总结

该论文提出ESA(实体注意力摘要),一种使用双向LSTM和注意力机制的监督深度学习模型,用于对RDF三元组进行排序,以生成简洁且信息丰富的实体摘要。通过利用谓词的词嵌入和对象的TransE表示,ESA在DBpedia、LinkedMDB及合并数据集上的F-measure和MAP指标上均优于当前最先进方法,其在top-5摘要中的F-measure最高提升达7.96%。

ABSTRACT

Entity summarization aims at creating brief but informative descriptions of entities from knowledge graphs. While previous work mostly focused on traditional techniques such as clustering algorithms and graph models, we ask how to apply deep learning methods into this task. In this paper we propose ESA, a neural network with supervised attention mechanisms for entity summarization. Specifically, we calculate attention weights for facts in each entity, and rank facts to generate reliable summaries. We explore techniques to solve difficult learning problems presented by the ESA, and demonstrate the effectiveness of our model in comparison with the state-of-the-art methods. Experimental results show that our model improves the quality of the entity summaries in both F-measure and MAP.

研究动机与目标

  • 为解决传统实体摘要方法依赖聚类或图模型而未利用深度学习的局限性。
  • 通过监督注意力建模人类偏好,提升知识图谱中实体摘要的质量。
  • 开发一种神经网络框架,有效基于信息量和相关性对RDF三元组进行排序。
  • 展示将词嵌入(用于谓词)与知识图谱嵌入(用于对象)结合在统一注意力模型中的有效性。

提出的方法

  • 该模型采用编码器-解码器结构的序列到序列架构,其中编码器使用BiLSTM和知识表示处理RDF三元组。
  • 谓词通过预训练的词嵌入进行表示,而对象则通过TransE知识图谱嵌入模型进行表示。
  • 监督注意力机制基于学习到的表示计算每个三元组的注意力权重,其标准注意力向量来源于ESBM基准数据集。
  • 注意力权重用于三元组排序,选择注意力权重最高的top-k个三元组作为最终的实体摘要。
  • 模型通过ESBM v1.1基准数据集提供的监督信号进行端到端训练,超参数在验证集上进行调优。
  • 通过分别建模谓词和对象,增强了知识表示能力,从而更有效地捕捉语义与关系信息。

实验结果

研究问题

  • RQ1与传统基于图或聚类的方法相比,深度神经网络中的监督注意力机制是否能提升实体摘要的质量?
  • RQ2将词嵌入用于谓词与TransE用于对象相结合,在表示RDF三元组用于摘要任务方面有多高效?
  • RQ3基于BiLSTM的编码器结合注意力机制,在标准实体摘要基准上对F-measure和MAP指标的提升程度如何?
  • RQ4该模型能否在DBpedia和LinkedMDB等多样化的知识图谱上保持高性能并实现良好泛化?

主要发现

  • 在DBpedia数据集的top-5摘要中,ESA实现了0.310的最高F-measure,较先前最先进方法(CD)高出0.023。
  • 在DBpedia与LinkedMDB的合并数据集上,与最佳基线相比,ESA在top-5摘要中F-measure提升7.96%,在top-10摘要中提升5.82%。
  • 在DBpedia的top-5摘要中,ESA的MAP得分为0.392;在LinkedMDB的top-5摘要中,MAP得分为0.367,较所有基线方法至少高出0.030。
  • 在LinkedMDB上,对于k=10的情况,MAP得分最高提升达0.056,表明在排序质量指标上表现更优。
  • 在所有数据集和指标上,ESA始终优于所有对比方法——RELIN、DIVERSUM、CD、FACES、FACES-E和LinkSUM。
  • 将谓词的词嵌入与对象的TransE相结合,显著提升了表示质量,从而实现更精确的注意力加权与更优的摘要生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。