Skip to main content
QUICK REVIEW

[论文解读] Siamese recurrent networks learn first-order logic reasoning and exhibit zero-shot compositional generalization

Mathijs Mul, Willem Zuidema|arXiv (Cornell University)|Jun 1, 2019
Topic Modeling参考文献 35被引用 16
一句话总结

该论文表明,带有LSTM和GRU单元的孪生循环神经网络(SRNs)可在无显式句法或语义先验的情况下,学习一种合成的、组合性语言中的的一阶逻辑蕴含关系。这些模型在未见过的句子长度和新词汇上实现了接近完美的零样本组合泛化,优于递归网络,并对本体的语义重新分配表现出鲁棒性。

ABSTRACT

Can neural nets learn logic? We approach this classic question with current methods, and demonstrate that recurrent neural networks can learn to recognize first order logical entailment relations between expressions. We define an artificial language in first-order predicate logic, generate a large dataset of sample 'sentences', and use an automatic theorem prover to infer the relation between random pairs of such sentences. We describe a Siamese neural architecture trained to predict the logical relation, and experiment with recurrent and recursive networks. Siamese Recurrent Networks are surprisingly successful at the entailment recognition task, reaching near perfect performance on novel sentences (consisting of known words), and even outperforming recursive networks. We report a series of experiments to test the ability of the models to perform compositional generalization. In particular, we study how they deal with sentences of unseen length, and sentences containing unseen words. We show that set-ups using LSTMs and GRUs obtain high scores on these tests, demonstrating a form of compositionality.

研究动机与目标

  • 探究循环神经网络是否能在无符号先验的情况下学习一阶谓词逻辑中的组合性逻辑推理。
  • 测试深度学习模型是否能超越记忆化,特别是泛化到新颖的句子结构和未见过的词汇。
  • 开发一种可扩展的、自动化的数据生成流水线,用于逻辑蕴含任务,结合形式逻辑与定理证明。
  • 通过在未见长度和新词汇上的零样本测试,评估RNN的组合泛化能力。
  • 比较孪生RNN与递归网络在学习逻辑推理任务中的表现,重点关注网络架构的归纳偏置。

提出的方法

  • 使用一阶逻辑(FOL)定义一种人工语言,包含四种词汇类别:量词、名词、动词和副词。
  • 通过短语结构语法生成句子,并利用标准的一阶定理证明器自动推断蕴含关系。
  • 设计一种孪生神经架构,处理句子对并预测七种蕴含关系中的一种(蕴含、矛盾等)。
  • 在句子对上训练循环网络(LSTM、GRU),通过共享权重在孪生设置中比较表示。
  • 通过替换词汇为未见过的术语或改变本体结构,同时保持句法和语义结构,实施零样本泛化测试。
  • 使用词嵌入作为输入特征,不引入显式的句法解析或符号控制结构。

实验结果

研究问题

  • RQ1循环神经网络是否能在无任何符号归纳偏置的情况下,学习识别一阶逻辑蕴含关系?
  • RQ2孪生RNN在推理过程中对未见过的句子长度的泛化能力如何?
  • RQ3模型能否泛化到训练期间完全未见过的词汇构成的句子?
  • RQ4当名词本体发生语义重新分配(如从人类群体变为动物或宗教)时,模型的鲁棒性如何?
  • RQ5孪生RNN在逻辑推理任务中是否优于专为建模句法层次结构而设计的递归网络?

主要发现

  • 使用GRU和LSTM单元的孪生循环网络(SRNs)在由已知词汇构成的新句子上的蕴含识别测试准确率达到97.2%。
  • GRU模型在将所有训练名词替换为完全未见过的词汇(r₄)后,仍保持86.7%的准确率,表明其具备强大的零样本组合泛化能力。
  • 即使将名词本体重新组织为语义无关的领域(如动物、宗教、美国),GRU模型的准确率仍保持在56.3%至59.0%之间,显著高于七分类问题的随机水平。
  • SRN的性能优于递归神经网络,尽管后者被明确设计用于建模句法层次结构。
  • 模型能有效泛化到未见的句子长度,表明其已学习组合规则而非记忆模式。
  • 结果表明,循环网络可在形式语言中学习并应用组合性逻辑规则,挑战了深度学习无法实现此类推理的传统观点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。