[論文レビュー] Learning to Prove Theorems by Learning to Generate Theorems
本論文では、メタマスの自動定理証明のための限られた人間による証明データを補完するために、合成された定理と証明を生成する学習可能なニューラルジェネレータ、MetaGenを提案する。生成器を人間の証明に基づいて模倣学習またはGANに類似した識別器を用いた強化学習で訓練することで、定理証明者の性能が著しく向上し、set.mmおよびiset.mmベンチマークにおいて、先行手法よりも多くの定理を証明することで、最先端の性能を達成した。
We consider the task of automated theorem proving, a key AI task. Deep learning has shown promise for training theorem provers, but there are limited human-written theorems and proofs available for supervised learning. To address this limitation, we propose to learn a neural generator that automatically synthesizes theorems and proofs for the purpose of training a theorem prover. Experiments on real-world tasks demonstrate that synthetic data from our approach improves the theorem prover and advances the state of the art of automated theorem proving in Metamath. Code is available at https://github.com/princeton-vl/MetaGen.
研究の動機と目的
- 形式的言語(メタマスを含む)における人間による形式的証明の不足が、定理証明者の教師あり学習を制限するという問題に対処すること。
- 定理証明者の学習に適した高品質で多様な定理と証明を自動的に合成するニューラルジェネレータを開発すること。
- 学習可能なジェネレータによって生成された合成データを用いて、限られた人間のデータを拡張することで、定理証明者の性能を向上させること。
- 2つの訓練パラダイムの検討:人間の証明から模倣学習を行うことと、GAN風の識別器を用いた強化学習により、合成定理が人間のパターンに類似するように導くこと。
提案手法
- 定理証明者のように記号操作を行うことで、既存の定理に推論規則を適用して新しい定理と証明を合成するニューラルジェネレータ(MetaGen)を訓練する。
- 完全な証明が利用可能な場合に限り、生成器が人間の証明手順を前向きに追従するように、模倣学習を用いて訓練する。
- 証明のステートメントのみが利用可能な場合に、識別器を用いた強化学習により、生成器が人間の証明に類似した合成定理を生成するように導く。
- 識別器が実際の人間の定理と合成定理を区別するGANに類似した訓練目的を導入し、生成器が現実的で有用な定理を生成するように促進する。
- 合成データをHolophrasmニューラル証明者に統合し、その関連性および置換ネットワークを微調整して、証明探索の性能を向上させる。
- 標準的なプロトコルに従い、set.mmおよびiset.mmの標準的なメタマスベンチマークで証明者を評価し、ベースラインおよびアブレーションと性能を比較する。
実験結果
リサーチクエスチョン
- RQ1学習可能なニューラルジェネレータは、定理証明者の性能を効果的に向上させる合成定理と証明を生成できるか?
- RQ2模倣学習または識別器を用いた強化学習によって生成された合成データは、人間のみのデータよりも一般化性能が優れているか?
- RQ3合成データの質は、ニューラル証明者の関連性および置換ネットワークの向上において、人間のデータと比較してどの程度優れているか?
- RQ4合成データは、高価な人間による証明に依存する必要をどれだけ減らすことができるか、かつ証明完了率を維持または向上させられるか?
主な発見
- MetaGenから得た合成データで訓練された証明者は、iset.mmベンチマークで600個の定理を証明し、元のHolophrasmを上回り、最先端の性能を達成した。
- set.mmでは、10%の人間証明と合成データで訓練された証明者が472個の定理を証明し、100%の人間データで訓練されたモデルの476個にほぼ達した。
- 関連性ネットワークは、合成データで訓練した場合にトップ-k正解率および平均逆順位が向上し、特に学習可能なジェネレータで最も良い結果を得た。
- 置換ネットワークは、合成データで訓練した場合に、正解率および正規化確率スコアが向上し、特に学習可能なジェネレータで顕著な改善が見られた。
- 訓練データから自明な証明手順を除外したことで、証明された定理数が574個から600個に増加し、データ品質の重要性が示された。
- GPU最適化版のHolophrasmの再実装は、set.mmで557個の定理を証明し、元のWhalen (2016) の研究で報告された数を超えた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。