Skip to main content
QUICK REVIEW

[论文解读] OpenKI: Integrating Open Information Extraction and Knowledge Bases with Relation Inference

Dongxu Zhang, Subhabrata Mukherjee|arXiv (Cornell University)|Apr 12, 2019
Semantic Web and Ontologies参考文献 29被引用 10
一句话总结

OpenKI 提出了一种联合模型,通过融合来自开放信息抽取(OpenIE)和知识库(KB)的实体邻域嵌入,实现开放信息抽取与知识库的联合建模,以提升关系推理性能。该模型利用注意力机制对实体邻域进行建模,在推理过程中不依赖实体特异性参数,从而在 OpenIE-to-KB 对齐任务上相比最先进方法实现了 33.5% 的平均 MAP 提升。

ABSTRACT

In this paper, we consider advancing web-scale knowledge extraction and alignment by integrating OpenIE extractions in the form of (subject, predicate, object) triples with Knowledge Bases (KB). Traditional techniques from universal schema and from schema mapping fall in two extremes: either they perform instance-level inference relying on embedding for (subject, object) pairs, thus cannot handle pairs absent in any existing triples; or they perform predicate-level mapping and completely ignore background evidence from individual entities, thus cannot achieve satisfying quality. We propose OpenKI to handle sparsity of OpenIE extractions by performing instance-level inference: for each entity, we encode the rich information in its neighborhood in both KB and OpenIE extractions, and leverage this information in relation inference by exploring different methods of aggregation and attention. In order to handle unseen entities, our model is designed without creating entity-specific parameters. Extensive experiments show that this method not only significantly improves state-of-the-art for conventional OpenIE extractions like ReVerb, but also boosts the performance on OpenIE from semi-structured data, where new entity pairs are abundant and data are fairly sparse.

研究动机与目标

  • 解决将 OpenIE 抽取的(主语,谓词,宾语)三元组对齐到结构化知识库(KB)的挑战,其中关系未对齐且常存在重复。
  • 克服现有方法的局限性:谓词级模式映射忽略实体特异性上下文,而实例级推理因依赖实体特异性参数而在未见实体上失效。
  • 在低资源、稀疏 OpenIE 环境下提升关系推理性能,尤其适用于半结构化数据中频繁出现新实体对的场景。
  • 通过避免使用实体特异性参数,同时仍利用实体邻域中的丰富上下文信号,实现对未见实体的有效泛化。
  • 设计一种可扩展的端到端模型,利用 KB 和 OpenIE 的图结构信息,学习软性、细粒度的关系约束。

提出的方法

  • 通过聚合来自 KB 和 OpenIE 抽取结果的关联信号,构建实体邻域嵌入,捕捉每个实体周围的局部图结构。
  • 利用注意力机制在关系推理过程中动态加权邻近关系和谓词的重要性,实现上下文感知推理。
  • 设计一种联合推理模型,将实体邻域嵌入与关系级预测相结合,实现归纳偏置,同时避免学习每实体的参数。
  • 对邻域特征应用不同的聚合策略(如平均、最大值、注意力加权)以优化关系预测性能。
  • 使用可微分损失函数端到端训练模型,将 OpenIE 谓词对齐到 KB 关系,同时利用文本和结构信号。
  • 通过仅依赖邻域嵌入而非实体特异性嵌入或参数,确保对未见实体的归纳偏置。

实验结果

研究问题

  • RQ1我们能否通过融合来自知识库和 OpenIE 抽取的多源丰富信号,提升 OpenIE-to-KB 关系对齐性能?
  • RQ2如何在不引入实体特异性参数的前提下,有效建模实体特异性上下文,以支持对未见实体的零样本推理?
  • RQ3与谓词级或实例级基线相比,KB 和 OpenIE 的邻域嵌入在多大程度上提升了关系推理的准确性?
  • RQ4在稀疏 OpenIE 环境下,注意力机制对实体邻域的建模是否能比简单聚合方法更好地捕捉相关的关系模式?
  • RQ5结合来自两个源的结构图信息,是否能显著优于仅依赖谓词间文本或语义相似性的方法?

主要发现

  • OpenKI 在多个数据集上相比最先进基线实现了 33.5% 的平均 MAP 提升,展现出强大的泛化能力和鲁棒性。
  • 该模型显著优于基于 ReVerb 的 OpenIE 基线,在半结构化数据源上表现突出,尤其在新实体对频繁出现且数据稀疏的场景中取得显著提升。
  • 仅使用实体邻域嵌入(无需任何文本编码器)即取得优异性能,凸显了结构图信号在关系推理中的关键作用。
  • 消融实验证实,邻域聚合与注意力机制是关键组件,其中基于注意力的聚合优于简单的平均或最大池化。
  • 该模型能有效泛化到未见实体,因其避免学习实体特异性参数,转而依赖从邻域关系中提取的上下文嵌入。
  • 该方法具有可扩展性且领域无关,因端到端、自监督学习关系信号,仅需极少调参且无需人工设计特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。