Skip to main content
QUICK REVIEW

[論文レビュー] Siamese recurrent networks learn first-order logic reasoning and exhibit zero-shot compositional generalization

Mathijs Mul, Willem Zuidema|arXiv (Cornell University)|Jun 1, 2019
Topic Modeling参考文献 35被引用数 16
ひとこと要約

この論文は、構文的・意味的プリオンなしで、合成的で構成的である言語において、LSTMおよびGRUセルを備えたシアンプス再帰ニューラルネットワーク(SRN)が、1階述語論理における含意関係を学習できることを示している。モデルは、未知の文の長さや新しい語彙に対してほぼ完璧なゼロショット構成的一般化を達成し、再帰的ネットワークを上回り、オントロジーの意味的再割り当てに対しても頑健である。

ABSTRACT

Can neural nets learn logic? We approach this classic question with current methods, and demonstrate that recurrent neural networks can learn to recognize first order logical entailment relations between expressions. We define an artificial language in first-order predicate logic, generate a large dataset of sample 'sentences', and use an automatic theorem prover to infer the relation between random pairs of such sentences. We describe a Siamese neural architecture trained to predict the logical relation, and experiment with recurrent and recursive networks. Siamese Recurrent Networks are surprisingly successful at the entailment recognition task, reaching near perfect performance on novel sentences (consisting of known words), and even outperforming recursive networks. We report a series of experiments to test the ability of the models to perform compositional generalization. In particular, we study how they deal with sentences of unseen length, and sentences containing unseen words. We show that set-ups using LSTMs and GRUs obtain high scores on these tests, demonstrating a form of compositionality.

研究の動機と目的

  • 再帰的ニューラルネットワークが、記号的プリオンなしで1階述語論理における構成的論理的推論を学習できるかどうかを調査すること。
  • 深層学習モデルが記憶に依存するのではなく、特に未知の文構造や未学習語彙に対して一般化できるかどうかをテストすること。
  • 形式論理と定理証明を用いて、論理的含意タスクのためのスケーラブルで自動的なデータ生成パイプラインを開発すること。
  • 未知の長さと新しい語彙に対するゼロショットテストを用いて、RNNの構成的一般化能力を評価すること。
  • 構造的インダクティブバイアスに焦点を当て、シアンプスRNNと再帰的ネットワークの論理的推論における性能を比較すること。

提案手法

  • 4つの語彙的カテゴリー(限定詞、名詞、動詞、副詞)を用いた1階述語論理(FOL)に基づく人工言語を定義する。
  • フレーズ構造文法を用いて文を生成し、標準的な1階述語論理定理証明機を自動的に用いて含意関係を推論する。
  • 2つの文のペアを処理し、7つの含意関係(含意、矛盾など)の1つを予測するシアンプスニューラルアーキテクチャを設計する。
  • 共有重みを用いたシアンプス設定で、LSTMおよびGRUを用いて文のペアを学習し、表現を比較する。
  • 語彙を未学習のものに置き換えたり、オントロジー構造を変更しながらも文法的・意味的構造を維持した状態で、ゼロショット一般化テストを実施する。
  • 構文解析や記号的制御構造を明示的に用いない、単語埋め込みを入力特徴として使用する。

実験結果

リサーチクエスチョン

  • RQ1再帰的ニューラルネットワークは、記号的インダクティブバイアスを一切持たずに、1階述語論理における含意関係を認識できるか?
  • RQ2推論時に、未知の文の長さに対してシアンプスRNNはどの程度一般化できるか?
  • RQ3学習中に見られなかった完全に新しい語彙を含む文に対しても、モデルは一般化できるか?
  • RQ4たとえば人間の集団から動物や宗教へと意味的再割り当てがなされた場合、モデルの性能はどの程度頑健か?
  • RQ5階層的構造を明示的にモデル化するように設計された再帰的ネットワークと比較して、シアンプスRNNは論理的推論タスクで優れているか?

主な発見

  • GRUおよびLSTMセルを備えたシアンプス再帰ネットワーク(SRN)は、既知の語彙から構成された未知の文について、97.2%のテスト精度を達成した。
  • GRUモデルは、すべての訓練用名詞を完全に未知のものに置き換えても(r₄)、86.7%の精度を維持し、強いゼロショット構成的一般化を示した。
  • 名詞オントロジーが意味的に関連のない分野(例:動物、宗教、アメリカ)に再構成されても、GRUモデルは56.3%~59.0%の精度を維持し、7クラス分類問題においては著しくランダムより高い水準を示した。
  • 再帰的ニューラルネットワークでさえも、構文的階層を明示的にモデル化するように設計されているにもかかわらず、SRNの性能はそれを上回った。
  • 未知の文の長さに対しても効果的に一般化していることから、モデルはパターンの記憶ではなく、構成的ルールを学習していると示唆される。
  • 結果から、再帰的ネットワークが形式言語において構成的論理ルールを学び、適用できることを示しており、このような推論が深層学習の範囲を超えているという見方を覆すものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。