Skip to main content
QUICK REVIEW

[论文解读] Learning to Prove Theorems by Learning to Generate Theorems

Mingzhe Wang, Jia Deng|arXiv (Cornell University)|Feb 17, 2020
Machine Learning and Algorithms参考文献 41被引用 7
一句话总结

该论文提出 MetaGen,一种可学习的神经生成器,通过合成人工定理和证明来增强 Metamath 中自动化定理证明的有限人工编写训练数据。通过模仿学习或使用类似 GAN 的判别器进行强化学习,在人类证明上训练该生成器,该方法显著提升了定理证明器的性能,在 set.mm 和 iset.mm 域上实现了新的 SOTA(最先进)水平,证明的定理数量超过以往方法。

ABSTRACT

We consider the task of automated theorem proving, a key AI task. Deep learning has shown promise for training theorem provers, but there are limited human-written theorems and proofs available for supervised learning. To address this limitation, we propose to learn a neural generator that automatically synthesizes theorems and proofs for the purpose of training a theorem prover. Experiments on real-world tasks demonstrate that synthetic data from our approach improves the theorem prover and advances the state of the art of automated theorem proving in Metamath. Code is available at https://github.com/princeton-vl/MetaGen.

研究动机与目标

  • 为了解决形式语言(如 Metamath)中人工编写的形式化证明稀缺的问题,该问题限制了定理证明器的监督训练。
  • 开发一种神经生成器,可自动合成高质量、多样化的定理和证明,用于定理证明器的训练。
  • 通过使用可学习生成器生成的合成数据来增强有限的人工数据,从而提升定理证明器的性能。
  • 探索两种训练范式:从人类证明中进行模仿学习,以及使用类似 GAN 的判别器进行强化学习,以使合成定理与人类风格保持一致。

提出的方法

  • 训练一个神经生成器(MetaGen),通过执行类似于证明器的符号操作,利用现有定理的推理规则来合成新定理和证明。
  • 使用模仿学习训练生成器,使其在完整证明可用时,能够沿正向路径模仿人类证明步骤。
  • 在仅提供定理陈述而无完整证明时,使用强化学习结合判别器,引导生成器生成与人类写作模式相似的合成定理。
  • 引入类似 GAN 的训练目标,其中判别器用于区分真实人类定理与合成定理,从而促使生成器产出更真实、更有用的定理。
  • 将合成数据整合到 Holophrasm 神经证明器中,微调其相关性网络与替换网络,以提升证明搜索性能。
  • 使用标准协议在标准 Metamath 基准(set.mm 和 iset.mm)上评估证明器性能,与基线方法及消融实验进行对比。

实验结果

研究问题

  • RQ1可学习的神经生成器能否生成有效提升定理证明器性能的合成定理和证明?
  • RQ2通过模仿学习或结合判别器的强化学习生成的合成数据,是否在泛化能力上优于仅使用人类数据?
  • RQ3在提升神经证明器的相关性网络与替换网络方面,合成数据的质量与人类数据相比如何?
  • RQ4在保持或提升证明完成率的前提下,合成数据能在多大程度上减少对昂贵人工编写证明的依赖?

主要发现

  • 在 iset.mm 基准上,使用 MetaGen 合成数据训练的证明器成功证明了 600 个定理,优于原始 Holophrasm 模型,达到最先进性能。
  • 在 set.mm 上,使用 10% 人工证明与合成数据训练的证明器证明了 472 个定理,几乎与使用 100% 人工数据训练的模型(证明 476 个定理)持平。
  • 当使用合成数据训练时,证明器的相关性网络在 top-k 准确率与平均倒数排名(mean reciprocal rank)上表现更优,其中可学习生成器的效果最佳。
  • 在合成数据上训练时,替换网络的准确率与归一化概率得分均得到提升,尤其在使用可学习生成器时表现更佳。
  • 从训练数据中移除无意义的证明步骤后,证明定理数量从 574 个提升至 600 个,表明数据质量至关重要。
  • 对 Holophrasm 的 GPU 优化重实现版本在 set.mm 上证明了 557 个定理,超过原始 Whalen(2016)工作所报告的数量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。