Skip to main content
QUICK REVIEW

[论文解读] Building a Knowledge Graph from Natural Language Definitions for Interpretable Text Entailment Recognition

Vivian S. Silva, André Freitas|arXiv (Cornell University)|Jun 20, 2018
Topic Modeling被引用 5
一句话总结

本文提出一种方法,通过基于以实体为中心的角色的语义角色标注方法,从 WordNet 中的自然语言定义自动生成知识图 WordNetGraph。该图通过在术语之间导航路径,生成人类可读的推理说明,实现可解释的文本蕴涵识别,性能与现有方法相当,同时提供透明的推理过程。

ABSTRACT

Natural language definitions of terms can serve as a rich source of knowledge, but structuring them into a comprehensible semantic model is essential to enable them to be used in semantic interpretation tasks. We propose a method and provide a set of tools for automatically building a graph world knowledge base from natural language definitions. Adopting a conceptual model composed of a set of semantic roles for dictionary definitions, we trained a classifier for automatically labeling definitions, preparing the data to be later converted to a graph representation. WordNetGraph, a knowledge graph built out of noun and verb WordNet definitions according to this methodology, was successfully used in an interpretable text entailment recognition approach which uses paths in this graph to provide clear justifications for entailment decisions.

研究动机与目标

  • 从非结构化的自然语言定义中创建结构化且可解释的知识库。
  • 通过为决策生成人类可读的推理说明,提升文本蕴涵识别的可解释性。
  • 开发一种可扩展、可扩展至其他领域的方法,将词典定义转换为知识图。
  • 利用分布语义学实现基于路径的词汇定义推理。
  • 提供免费可用的工具,用于从定义构建知识图。

提出的方法

  • 采用基于以实体为中心的语义角色的概念模型:上位类、差异质量(differentia_quality)和差异事件(differentia_event),用于标注定义片段。
  • 训练有监督的机器学习分类器,自动为定义中的短语分配语义角色。
  • 将标注后的定义片段转换为 RDF 三元组,以构建 WordNetGraph 知识图。
  • 使用分布语义学,从文本蕴涵任务中的前提术语导航至假设术语。
  • 通过连接图中找到的最短路径上的节点内容,生成推理说明。
  • 提供开源工具,用于数据预处理、标注、分类器训练和 RDF 模型生成。

实验结果

研究问题

  • RQ1自然语言定义能否系统性地转化为结构化且可解释的知识图?
  • RQ2基于词典定义构建的知识图能否支持可解释的文本蕴涵识别?
  • RQ3在该类知识图中基于路径的导航能否生成人类可读的蕴涵决策推理?
  • RQ4该方法的性能与现有文本蕴涵方法相比如何?
  • RQ5该方法在多大程度上可扩展至 WordNet 以外的其他词汇资源?

主要发现

  • 成功使用语义角色标注方法,从 WordNet 中的名词和动词定义构建了 WordNetGraph 知识库。
  • 该方法通过基于知识图路径生成的推理说明,实现了可解释的文本蕴涵识别。
  • 该方法的性能与现有文本蕴涵方法(如树编辑距离和基于分类的模型)相当。
  • 基于图路径生成的推理说明简洁且人类可读,显著提升了系统的可解释性。
  • 该框架具有可扩展性,并已成功应用于 BPI 数据集和 Guardian Headlines 数据集,结果一致。
  • 一套完整的工具集(涵盖数据处理、标注和知识图生成)已公开提供。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。