[论文解读] Training a First-Order Theorem Prover from Synthetic Data
该论文提出仅使用合成生成的定理来训练一阶定理证明器,避免使用人工标注的数据。通过使用前向生成器生成有效定理,并利用神经引导进行搜索策略蒸馏,该证明器在合成数据上的表现优于E-prover,并在未见过的TPTP问题(无等式)上实现了72%的成功率,展现出强大的零样本迁移能力。
A major challenge in applying machine learning to automated theorem proving is the scarcity of training data, which is a key ingredient in training successful deep learning models. To tackle this problem, we propose an approach that relies on training purely with synthetically generated theorems, without any human data aside from axioms. We use these theorems to train a neurally-guided saturation-based prover. Our neural prover outperforms the state-of-the-art E-prover on this synthetic data in both time and search steps, and shows significant transfer to the unseen human-written theorems from the TPTP library, where it solves 72\% of first-order problems without equality.
研究动机与目标
- 为解决神经定理证明中训练数据稀缺的问题,通过生成合成定理而非依赖人工标注的形式化内容。
- 仅使用合成数据训练一个神经引导的饱和式证明器,不依赖人工提供的证明或示例。
- 评估在合成数据上训练的证明器是否能泛化到TPTP库中真实世界的人工编写定理。
- 优化合成数据生成过程,以提升多样性、难度和规模,从而最大化迁移性能。
提出的方法
- 前向生成器通过在线性归结作用于公理来生成合成定理,通过在子句大小上使用softmax对子句进行偏向,以优先生成更小的子句。
- 证明器使用给定子句算法,其神经代价函数结合了子句概率预测和子句大小,早期训练中大小项的权重比为64:1。
- 采用类似于AlphaZero的搜索蒸馏技术,通过在合成问题上的自我对弈来训练神经代价函数。
- 神经网络通过经验回放缓冲区进行训练,来自多个智能体的经验被使用,模型架构采用MLP或Transformer,处理子句特征。
- 子句特征包括文字计数、符号计数、谓词/函数符/变量的多样性,以及推理元数据,均被编码为固定长度的向量。
- 系统使用优先队列进行子句选择,并应用前向和后向归约以保持证明状态的效率。
实验结果
研究问题
- RQ1能否仅使用合成定理有效训练一阶定理证明器,而无需任何人工标注的证明?
- RQ2在合成数据上训练的证明器是否能泛化到TPTP库中真实世界的人工编写定理?
- RQ3合成数据生成参数(如步数、温度)如何影响向真实问题迁移的性能?
- RQ4与E-prover等基线证明器相比,神经引导对搜索效率有何影响?
主要发现
- 神经证明器在合成训练分布上的表现优于当前最先进的E-prover,解决了更多问题,耗时更短,且搜索步数更少。
- 在未见过的、无等式的TPTP测试集上,最佳训练的证明器实现了72%的成功率,显著优于非学习型证明器的42%基线水平。
- 该系统展现出强大的零样本迁移能力,在未接触任何TPTP数据的情况下成功解决了72%的TPTP问题。
- 前向生成器的超参数通过代理指标(大小、难度、多样性)进行调优,子句平均大小上限为64,且每组设置至少需生成500,000个唯一定理。
- 基于Transformer的神经代价函数在迁移性能上优于MLP,尽管两者均展现出强大的泛化能力。
- 将训练时间延长至两天以上对MLP模型未带来进一步提升,表明其已收敛;而Transformer模型则持续获得性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。