Skip to main content
QUICK REVIEW

[论文解读] Reasoning Over Virtual Knowledge Bases With Open Predicate Relations

Haitian Sun, Pat Verga|arXiv (Cornell University)|Feb 14, 2021
Topic Modeling参考文献 42被引用 7
一句话总结

本文提出开放谓词查询语言(OPQL),一种无需任何结构化监督即可从非结构化文本构建虚拟知识库(VKB)的方法,采用双编码器预训练方法对实体-关系对进行编码。OPQL支持高效的多跳推理,在集成到语言模型后,于开放域问答任务中实现最先进性能,且在组合推理任务上优于更大规模模型。

ABSTRACT

We present the Open Predicate Query Language (OPQL); a method for constructing a virtual KB (VKB) trained entirely from text. Large Knowledge Bases (KBs) are indispensable for a wide-range of industry applications such as question answering and recommendation. Typically, KBs encode world knowledge in a structured, readily accessible form derived from laborious human annotation efforts. Unfortunately, while they are extremely high precision, KBs are inevitably highly incomplete and automated methods for enriching them are far too inaccurate. Instead, OPQL constructs a VKB by encoding and indexing a set of relation mentions in a way that naturally enables reasoning and can be trained without any structured supervision. We demonstrate that OPQL outperforms prior VKB methods on two different KB reasoning tasks and, additionally, can be used as an external memory integrated into a language model (OPQL-LM) leading to improvements on two open-domain question answering tasks.

研究动机与目标

  • 解决现有虚拟KB依赖于现有结构化知识库的远程监督所带来的局限性。
  • 开发一种直接从非结构化文本语料库构建虚拟KB的方法,无需任何标注关系或结构化监督。
  • 支持从文本中提取的开放词汇关系上的组合式与多跳推理。
  • 将OPQL记忆模块集成到预训练语言模型中,以增强推理与问答能力。

提出的方法

  • OPQL构建一个键值记忆,其中键由主题实体嵌入与关系嵌入组合而成,值为目标实体嵌入。
  • 采用在实体链接文本语料上预训练的双编码器架构,学习实体-关系对的密集表示。
  • 该方法可直接从文本中学习开放式的自然语言关系(如“作者”),避免依赖预定义的KB模式。
  • OPQL通过基于查询嵌入检索相关键值对,支持对多个条目进行可微分推理。
  • 系统可在微调阶段向记忆中注入新知识条目,而无需重新训练关系编码器或语言模型。
  • OPQL作为外部记忆集成到语言模型(OPQL-LM)中,支持端到端训练,实现检索与推理的联合优化。

实验结果

研究问题

  • RQ1能否在不依赖现有结构化知识库监督的情况下,从文本中构建虚拟知识库?
  • RQ2OPQL能否有效支持从文本中提取的开放词汇自然语言关系上的多跳推理?
  • RQ3将OPQL作为外部记忆集成后,是否能在开放域问答任务上优于标准语言模型?
  • RQ4OPQL能否泛化到训练期间未见过的关系,特别是在组合推理场景中?
  • RQ5OPQL-LM在复杂推理基准测试中与更大参数量的语言模型相比表现如何?

主要发现

  • OPQL在两项多跳推理任务上优于先前最先进虚拟KB方法,且监督信号显著更少。
  • OPQL-LM在WebQSP上的Hits@1准确率达到51.9%,在ComplexWebQ上达到40.7%,超越多个大型语言模型,并在后者上创下新SOTA。
  • 向OPQL记忆中注入额外知识对后,覆盖率从54.6%提升至82.9%,WebQSP上的整体Hits@1准确率从51.9%提升至53.7%。
  • 消融实验表明,移除空嵌入会显著降低性能,表明其在鲁棒检索中的关键作用。
  • 具备组合推理支持的OPQL-LM在ComplexWebQ数据集上达到新SOTA,优于参数量大得多的文本到文本模型。
  • 该方法可扩展至数百万条目,实现高效检索与推理,且无需依赖启发式三元组检索机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。