Skip to main content
QUICK REVIEW

[论文解读] HOList: An Environment for Machine Learning of Higher-Order Theorem Proving (extended version)

Kshitij Bansal, Sarah M. Loos|arXiv (Cornell University)|Apr 5, 2019
Logic, programming, and type systems被引用 13
一句话总结

HOList 是一个基于 HOL Light 构建的开源强化学习环境,用于训练深度学习模型进行高阶定理证明。它包含一个源自形式化数学的综合基准,包括开普勒猜想的证明,并引入了 DeepHOL,一种在这一具有挑战性的推理任务中表现强劲的深度强化学习智能体。

ABSTRACT

We present an environment, benchmark, and deep learning driven automated theorem prover for higher-order logic. Higher-order interactive theorem provers enable the formalization of arbitrary mathematical theories and thereby present an interesting, open-ended challenge for deep learning. We provide an open-source framework based on the HOL Light theorem prover that can be used as a reinforcement learning environment. HOL Light comes with a broad coverage of basic mathematical theorems on calculus and the formal proof of the Kepler conjecture, from which we derive a challenging benchmark for automated reasoning. We also present a deep reinforcement learning driven automated theorem prover, DeepHOL, with strong initial results on this benchmark.

研究动机与目标

  • 创建一个可扩展的开源环境,用于在高阶逻辑定理证明上训练机器学习模型。
  • 开发一个基于真实形式化数学的综合基准,包括基础定理和开普勒猜想的证明。
  • 使深度强化学习智能体能够学习在复杂且开放的数学领域中有效的证明搜索策略。
  • 证明将深度学习与高阶逻辑中的形式化定理证明相结合的可行性。

提出的方法

  • 该框架基于 HOL Light 定理证明器构建,为形式化数学中的强化学习提供结构化环境。
  • 该基准源自 HOL Light 中现有的形式化,包括微积分中的核心定理和开普勒猜想的证明。
  • 训练一个深度强化学习智能体 DeepHOL,通过策略网络预测证明搜索空间中的动作。
  • 该环境支持状态表示学习、动作空间定义以及基于证明进展和正确性的奖励设计。
  • 训练结合了模仿学习和强化学习,以提高证明搜索的效率和成功率。

实验结果

研究问题

  • RQ1深度强化学习智能体能否在使用真实、形式化的数学基准的情况下,学习在高阶逻辑中证明定理?
  • RQ2与基线策略相比,学习到的策略在复杂证明搜索空间中的导航效率如何?
  • RQ3预训练模型在高阶逻辑中多样化数学领域内的泛化能力在多大程度上得以实现?
  • RQ4结合模仿学习与强化学习能否提高定理证明中的样本效率?

主要发现

  • DeepHOL 在 HOList 基准上表现优异,证明了深度强化学习在高阶定理证明中的可行性。
  • 源自 HOL Light 对微积分和开普勒猜想形式化的基准,为自动化推理提供了真实且具有挑战性的测试平台。
  • 将模仿学习与强化学习相结合,显著提升了证明搜索中的样本效率和收敛速度。
  • 开源框架支持可复现的研究,并为未来形式化数学人工智能系统的发展提供了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。