Skip to main content
QUICK REVIEW

[论文解读] Scalable Neural Methods for Reasoning With a Symbolic Knowledge Base

William W. Cohen, Haitian Sun|arXiv (Cornell University)|Feb 14, 2020
Topic Modeling参考文献 34被引用 17
一句话总结

本文提出了一种基于稀疏矩阵的重言式知识库(KB)表示方法,实现了在大规模符号化KB上完全可微、可扩展且忠实的神经推理。通过将关系编码为可分布于多个GPU的稀疏矩阵,该方法相较于原始稀疏矩阵实现方式提速高达10,000倍,并支持在包含超过1300万个实体和4400万条事实的KB上进行神经语义解析与KB补全的端到端训练。

ABSTRACT

We describe a novel way of representing a symbolic knowledge base (KB) called a sparse-matrix reified KB. This representation enables neural modules that are fully differentiable, faithful to the original semantics of the KB, expressive enough to model multi-hop inferences, and scalable enough to use with realistically large KBs. The sparse-matrix reified KB can be distributed across multiple GPUs, can scale to tens of millions of entities and facts, and is orders of magnitude faster than naive sparse-matrix implementations. The reified KB enables very simple end-to-end architectures to obtain competitive performance on several benchmarks representing two families of tasks: KB completion, and learning semantic parsers from denotations.

研究动机与目标

  • 解决将大规模符号化知识库整合到可微神经架构中以实现端到端学习的挑战。
  • 克服先前神经KB方法在可扩展性、对原始KB语义的忠实度或支持多跳推理方面的局限性。
  • 利用GPU优化的稀疏矩阵表示,实现对大规模KB(如数千万个实体和事实)的高效、可扩展且可微分的推理。
  • 通过消除级联检索和神经模块,简化从指称表达式进行神经语义解析的过程,实现完全端到端训练。
  • 在真实世界基准和合成的长链推理任务中,验证方法的可扩展性和性能表现。

提出的方法

  • 将符号化KB表示为重言式KB,使用三个稀疏矩阵:一个用于主体,一个用于客体,一个用于关系索引,将每条三元组映射到其组件ID。
  • 使用指示向量将实体集和关系集编码为稠密向量,通过向量算术(求和、Hadamard积、1 - x)实现集合运算(并集、交集、补集)。
  • 将“跟随”操作定义为双线性变换:follow(x, r) = M_r x,其中M_r是关系r的稀疏矩阵,从而实现在关系上的可微路径追踪。
  • 通过关系矩阵的加权和(M_R = Σ w_r M_r)建模涉及多个关系的复杂查询,其中权重由网络学习得到。
  • 通过分割稀疏矩阵,将重言式KB分布到多个GPU上,支持在包含超过1300万个实体和4400万条事实的KB上进行训练。
  • 将重言式KB作为可微模块集成到神经网络中,支持通过推理步骤进行反向传播,实现从指称表达式或KB补全目标的端到端学习。

实验结果

研究问题

  • RQ1能否以一种方式表示符号化KB,从而实现在大规模KB上的完全可微、可扩展且忠实的神经推理?
  • RQ2如何在可微神经框架中高效且准确地建模大规模KB上的多跳推理?
  • RQ3所提方法是否能在保持语义保真度的同时,相较于原始稀疏矩阵实现方式实现显著提速?
  • RQ4能否仅通过可微推理,无需启发式检索或强化学习,实现从指称表达式出发的端到端神经语义解析?
  • RQ5该方法在合成与真实世界基准中,对长链推理和大规模KB的可扩展性如何?

主要发现

  • 稀疏矩阵重言式KB表示支持完全可微、忠实于原始KB语义的神经推理,并具备足够的表达能力以支持多跳推理。
  • 在合成数据上,与原始稀疏矩阵实现方式相比,该方法提速超过10,000倍,即使在关系数量众多的情况下依然如此。
  • 该架构可扩展至包含超过1300万个实体和近4400万条事实的KB,证明了其在真实世界大规模KB中的可行性。
  • 仅使用重言式KB模块的简单端到端神经架构,在KB补全和从指称表达式进行语义解析的基准测试中均取得了具有竞争力的性能。
  • 该方法实现了从指称表达式出发的完全端到端神经语义解析——此前由于KB推理不可微而难以实现——且无需级联检索或强化学习。
  • 该方法在合成任务中支持长链推理,展现出在复杂推理场景下的鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。