Skip to main content
QUICK REVIEW

[论文解读] Hammering Mizar by Learning Clause Guidance

Jan Jakubův, Josef Urban|arXiv (Cornell University)|Apr 2, 2019
Logic, programming, and type systems参考文献 27被引用 20
一句话总结

该论文通过在E自动定理证明器的整个Mizar数学图书馆上整合机器学习以指导内部子句选择,实现了实时证明性能70%的提升。系统通过从证明轨迹中迭代学习(使用基于哈希子句特征的XGBoost),逐步演化出更有效的证明策略,表明端到端学习的内部引导优于大型理论形式化中的手工调优策略。

ABSTRACT

We describe a very large improvement of existing hammer-style proof automation over large ITP libraries by combining learning and theorem proving. In particular, we have integrated state-of-the-art machine learners into the E automated theorem prover, and developed methods that allow learning and efficient internal guidance of E over the whole Mizar library. The resulting trained system improves the real-time performance of E on the Mizar library by 70% in a single-strategy setting.

研究动机与目标

  • 提升自动化定理证明器在大型交互式定理证明(ITP)库上的实时性能。
  • 解决现有锤子工具的局限性,即仅关注前提选择,而未涉及内部证明搜索引导。
  • 为基于饱和的ATP(如E)在像Mizar这样的大规模库上,开发一种可扩展、高效的内部子句选择学习方法。
  • 评估端到端机器学习是否能在大规模理论证明搜索中超越人工设计的策略。

提出的方法

  • 将XGBoost梯度提升树集成到E定理证明器中,利用学习到的权重指导给定子句的选择。
  • 使用特征哈希将高维手工构造的子句特征压缩到可管理的65,536维空间,同时保持模型性能并提升效率。
  • 应用类似MaLARea的反馈循环:在Mizar库上运行E,从成功证明中提取正/负样本作为训练数据,重新训练分类器,并应用改进后的策略。
  • 在26,107道问题的6300万条证明搜索示例上训练模型,通过逐步增加树深度(9、12、16)评估其对性能的影响。
  • 采用组合策略,将基线E策略与学习到的模型(记为⊕)结合,以提升鲁棒性和解题覆盖率。
  • 通过测量推理速度、模型大小和训练时间,评估学习引导系统的可扩展性和效率。

实验结果

研究问题

  • RQ1基于机器学习的内部子句选择能否显著提升基于饱和的ATP在大型ITP库(如Mizar)上的实时性能?
  • RQ2在大规模证明搜索中,无需手工特征工程的端到端子句选择学习,是否优于传统特征工程方法?
  • RQ3从证明轨迹中迭代学习如何影响ATP在多轮策略优化中累积性能的提升?
  • RQ4特征哈希能否在保持高模型准确率的同时,实现对数百万条证明示例的可扩展训练?
  • RQ5在严格时间限制下,与人工调优的基线策略相比,学习到的策略在解决的问题数量上能带来多大性能提升?

主要发现

  • 最佳学习策略E ⊕ M₁₆³在60秒内解决了26,107道问题,相比基线策略实现实时性能70%的提升。
  • 在单轮10秒时间限制下,树深为16的策略相比基线提升了70%的性能,解决了比以往任何E策略更多的问题。
  • 组合策略(E ⊕ M₁₆³)比由26种先前演化出的E策略组成的六策略组合(每种运行10秒)多解决了18.3%的问题。
  • 尽管深层树导致推理速度下降15%,但更高的准确性带来了更好的实时性能,表明模型复杂度是合理的。
  • 使用200棵树和2¹⁵哈希基数的模型在40GB数据和12个CPU天的训练下达到高性能,证明了其在大规模证明语料上的可扩展性。
  • 迭代学习在首次迭代后仍持续带来性能提升,每轮后续循环均新增可解问题并进一步优化策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。