Skip to main content
QUICK REVIEW

[论文解读] Tell Me Why Is It So? Explaining Knowledge Graph Relationships by Finding Descriptive Support Passages

Sumit Bhatia, Purusharth Dwivedi|arXiv (Cornell University)|Mar 17, 2018
Topic Modeling参考文献 29被引用 3
一句话总结

本文提出了一种概率性、无监督的方法,用于从大规模语料库(维基百科)中对段落进行排序,以提供知识图谱(Wikidata)中关系的描述性解释。通过结合语言模型的段落级和文档级证据,该方法在用户研究中显著优于基线模型,显著提升了自动化知识库的可解释性与用户信任度。

ABSTRACT

We address the problem of finding descriptive explanations of facts stored in a knowledge graph. This is important in high-risk domains such as healthcare, intelligence, etc. where users need additional information for decision making and is especially crucial for applications that rely on automatically constructed knowledge bases where machine learned systems extract facts from an input corpus and working of the extractors is opaque to the end-user. We follow an approach inspired from information retrieval and propose a simple and efficient, yet effective solution that takes into account passage level as well as document level properties to produce a ranked list of passages describing a given input relation. We test our approach using Wikidata as the knowledge base and Wikipedia as the source corpus and report results of user studies conducted to study the effectiveness of our proposed model.

研究动机与目标

  • 为医疗保健和情报等高风险领域中知识图谱关系提供描述性、人类可读的解释。
  • 通过为从非结构化文本中提取的事实提供上下文支持,提升用户信任度与决策能力。
  • 开发一种无需模板或预定义路径的可解释、无监督解决方案。
  • 通过用户研究评估基于段落的解释在相关性与信息量方面的有效性。
  • 通过将抽象三元组与自然语言上下文关联,实现更好的探索性搜索与知识发现。

提出的方法

  • 该方法使用一种概率排序模型,结合段落级和文档级证据,对候选段落进行打分。
  • 段落级相关性通过语言模型建模,该模型估计关系三元组在段落中出现的可能性。
  • 文档级证据通过一个提升项(boosting term)引入,该机制提高那些包含相关实体高频提及的文档中段落的得分。
  • 最终得分通过加权组合段落似然与文档证据计算得出,形式化表达见论文中的公式5。
  • 该方法为无监督方法,无需标注训练数据或模板。
  • 系统使用Wikidata作为知识库,从维基百科中检索并排序段落,不依赖外部知识或预训练模型。

实验结果

研究问题

  • RQ1段落级与文档级证据能否有效结合,以对知识图谱关系的解释性段落进行排序?
  • RQ2与仅依赖词重叠或频率的基线方法相比,所提方法表现如何?
  • RQ3用户研究在多大程度上证实了所提段落能提升对知识图谱事实的理解与信任?
  • RQ4当关键词在段落中仅出现一次时,该方法是否仍能识别出相关且富含上下文的解释?
  • RQ5在解释生成过程中,最常见的错误或误排序类型是什么?

主要发现

  • 在用户研究中,所提方法显著优于依赖词频与段落重叠的强基线模型。
  • 与基线相比,模型生成的段落被评价为更具信息量与相关性,尤其在关键词仅出现一次的情况下表现更优。
  • 文档级证据组件在提升相关段落方面发挥了关键作用,即使这些段落仅包含目标术语的单次提及。
  • 用户评估者经常拒绝那些提及实体但未描述特定关系的段落,凸显了上下文相关性的重要性。
  • 错误分析揭示了两种主要失败模式:段落讨论了实体但未解释关系,以及段落仅包含关系的间接或短暂提及。
  • 结果表明,将语言建模与文档级证据结合,可生成更有效、更可信的知识图谱事实解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。