Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Reinforcement Learning based Approach to Learning Transferable Proof Guidance Strategies.

Maxwell Crouse, Spencer Whitehead|arXiv (Cornell University)|Nov 5, 2019
Logic, programming, and type systems参考文献 35被引用数 9
ひとこと要約

TRAIL は、証明状態を節として表現し、推論行動を扱い、節同士の相互作用をモデル化するための新しいアテンション機構を用いることで、一階論理の定理証明における移譲可能な証明誘導戦略を、深層強化学習によって学習するシステムである。この手法は、語彙が異なるドメイン間で一般化できる一方で、ヒューリスティックに基づく証明器と同等の性能を達成する。

ABSTRACT

Traditional first-order logic (FOL) reasoning systems usually rely on manual heuristics for proof guidance. We propose TRAIL: a system that learns to perform proof guidance using reinforcement learning. A key design principle of our system is that it is general enough to allow transfer to problems in different domains that do not share the same vocabulary of the training set. To do so, we developed a novel representation of the internal state of a prover in terms of clauses and inference actions. We also propose a novel neural-based attention mechanism to learn interactions between clauses. We demonstrate that this approach enables the system to generalize from training to test data across domains with different vocabularies, suggesting that the neural architecture in TRAIL is well suited for representing and processing of logical formalisms. We also show that TRAIL's learned strategies provide a comparable performance to an established heuristics-based theorem prover.

研究の動機と目的

  • 語彙が異なるドメイン間で一般化可能な一階論理の証明誘導システムの開発。
  • FOL 推論における手作業によるヒューリスティクスの置き換えを、学習に基づくデータ駆動型戦略にすること。
  • 論理形式を効果的に表現・処理できるニューラルアーキテクチャの設計。
  • 訓練段階で学習した証明戦略を、語彙が異なる未学習ドメインに移譲可能にする。
  • 既存のヒューリスティックに基づく定理証明器と同等の性能を示すこと。

提案手法

  • TRAIL は、証明器の内部状態を節と推論行動として表現し、それをニューラルネットワークの入力とする。
  • 節同士の相互作用をモデル化するため、新しいニューラルアテンション機構を採用する。
  • 深層強化学習を用いて、状態表現に基づいて推論行動を選択する方策を学習する。
  • アーキテクチャは汎用的であり、訓練データとは異なる語彙を持つドメインへの適用を可能にする。
  • 方策の学習は強化学習により実施され、証明完了の成功を最適化する。
  • 戦略学習をドメイン固有の語彙から分離することで、ドメイン間の移譲が可能になる。

実験結果

リサーチクエスチョン

  • RQ1強化学習に基づくシステムは、語彙が異なるドメイン間で一般化可能な証明誘導戦略を学習できるか?
  • RQ2学習された戦略は、従来のヒューリスティックに基づく証明器と比べてどの程度の性能を示すか?
  • RQ3ニューラルアーキテクチャは、証明文脈における論理的節間の相互作用を効果的にモデル化できるか?
  • RQ4アテンション機構は、原始的な節表現に比べて、推論性能をどの程度向上させるか?
  • RQ5訓練時に見られなかったドメインで、システムは性能を維持できるか?

主な発見

  • TRAIL は、訓練データとは異なる語彙を持つテストドメインに対しても、効果的に一般化し、学習済み戦略の移譲性を示した。
  • システムは、既存のヒューリスティックに基づく定理証明器と同等の証明性能を達成した。
  • アテンション機構により、節間の相互作用が効果的にモデル化され、多様な論理形式にわたる頑健な推論に貢献した。
  • ニューラルアーキテクチャは、論理形式を効果的に表現・処理でき、ドメイン間での転移学習を支援した。
  • 手作業によるヒューリスティクスへの依存を低減しつつ、競争力のある性能を維持した。
  • 結果から、学習済み戦略が特定の語彙に依存していないことが示され、広範な適用可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。