Skip to main content
QUICK REVIEW

[论文解读] Proof Artifact Co-training for Theorem Proving with Language Models

Jesse Michael Han, Jason Rute|arXiv (Cornell University)|Feb 11, 2021
Topic Modeling参考文献 57被引用 6
一句话总结

本文提出 PACT(Proof Artifact Co-training),一种自监督方法,利用 Lean 中的内核级证明项生成大语言模型的辅助训练信号,显著提升策略预测性能。通过联合训练人类证明与自监督的证明产物,该方法将未见测试定理的定理证明成功率从 32% 提升至 48%。

ABSTRACT

Labeled data for imitation learning of theorem proving in large libraries of formalized mathematics is scarce as such libraries require years of concentrated effort by human specialists to be built. This is particularly challenging when applying large Transformer language models to tactic prediction, because the scaling of performance with respect to model size is quickly disrupted in the data-scarce, easily-overfitted regime. We propose PACT ({\bf P}roof {\bf A}rtifact {\bf C}o-{\bf T}raining), a general methodology for extracting abundant self-supervised data from kernel-level proof terms for co-training alongside the usual tactic prediction objective. We apply this methodology to Lean, an interactive proof assistant which hosts some of the most sophisticated formalized mathematics to date. We instrument Lean with a neural theorem prover driven by a Transformer language model and show that PACT improves theorem proving success rate on a held-out suite of test theorems from 32\% to 48\%.

研究动机与目标

  • 为了解决正式数学中标注数据稀缺的问题,其中人类证明形式化需要专家多年努力。
  • 提升大语言模型在交互式定理证明中策略预测的性能,尤其是在易受过拟合影响的数据稀缺场景下。
  • 开发一种可泛化的自监督方法,从证明项中提取训练信号,而无需人工标注。
  • 证明将 PACT 与预训练(如 WebMath)结合可显著提升分布外定理的泛化能力与性能。

提出的方法

  • PACT 通过从现有 Lean 人类证明中提取证明产物——完全类型化且经内核验证的证明项——构建自监督辅助任务。
  • 该方法联合训练基于 Transformer 的语言模型,优化标准策略预测目标以及从证明项结构和类型级不变量中导出的多个自监督目标。
  • 利用证明产物创建掩码语言建模与重构任务,使模型能够学习形式化证明的深层句法与语义结构。
  • 该方法被集成至 LeanStep,一个支持监督学习、强化学习及 PACT 联合训练的 Lean 3 数据集与训练环境。
  • 通过逐步增加复杂度的定理课程进行微调,同时在保留的测试集上监控性能。
  • 将 PACT 与 WebMath 预训练结合,以增强在新颖、分布外定理上的泛化能力与性能。

实验结果

研究问题

  • RQ1能否通过从证明产物中进行自监督学习,在数据稀缺的正式定理证明中显著提升策略预测性能?
  • RQ2与标准模仿学习相比,联合训练证明产物在泛化能力与鲁棒性方面表现如何?
  • RQ3PACT 在涉及新定义或复杂结构的分布外定理上,性能可提升至何种程度?
  • RQ4将 PACT 与大规模数学文本(如 WebMath)上的预训练结合,是否优于单独使用任一方法?

主要发现

  • PACT 将保留测试集上的定理证明成功率从 32% 提升至 48%,在数据稀缺场景下实现了显著性能提升。
  • PACT 与 WebMath 预训练结合后,验证损失最低且成功率最高,表明存在协同增益。
  • 在包含数千个定理的分布外测试集中——包括含新定义的定理——PACT 达到了 37% 的成功率,展现出强大的泛化能力。
  • 该模型生成的证明比人类编写的证明更简洁且更具通用性,例如使用了原始证明中未出现的复数引理。
  • 即使在训练数据中未出现,模型也能正确推断并应用如 @norm_eq_zero 这类引理,且正确填充参数占位符。
  • 通过 PACT 生成的证明常使用高级技巧,如 `simpa [...] using @...`,表明其对证明自动化模式有深入理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。