[论文解读] Mathematical Reasoning via Self-supervised Skip-tree Training
本文提出了一种用于形式数学表达式的自监督跳跃树训练方法,显著提升了标准跳跃序列方法在逻辑推理方面的表现。在 HOList 数据集上进行训练后,模型在类型推断、假设预测和等式补全等任务上表现优异,并且无需微调即可生成可证明且有用的猜想。
We examine whether self-supervised language modeling applied to mathematical formulas enables logical reasoning. We suggest several logical reasoning tasks that can be used to evaluate language models trained on formal mathematical statements, such as type inference, suggesting missing assumptions and completing equalities. To train language models for formal mathematics, we propose a novel skip-tree task. We find that models trained on the skip-tree task show surprisingly strong mathematical reasoning abilities, and outperform models trained on standard skip-sequence tasks. We also analyze the models' ability to formulate new conjectures by measuring how often the predictions are provable and useful in other proofs.
研究动机与目标
- 探究在无标注数据的情况下,对形式数学表达式进行自监督语言建模是否能够实现强大的逻辑推理能力。
- 提出一种新颖的代理训练任务——跳跃树,以尊重数学表达式的树状结构。
- 在无需微调的情况下,评估语言模型在多样化推理任务(包括机械推导和创造性猜想生成)上的表现。
- 通过检查猜想在现有证明中的可证明性和实用性,衡量模型生成猜想的有用性。
提出的方法
- 提出一种跳跃树任务,其中模型需预测被遮蔽的子树,同时保留形式数学表达式的层次结构。
- 在包含 HOL Light 中形式化数学的 HOList 数据集上训练基于 Transformer 的语言模型。
- 采用遮蔽预测目标,即模型预测缺失的子树而非线性排列的标记序列。
- 设计评估任务,如类型推断、缺失假设预测和等式补全,以测试模型的推理能力。
- 通过检查预测结果是否可证明以及是否在基于强化学习的证明搜索中作为前提使用,来评估猜想质量。
- 应用剪枝步骤,过滤掉平凡或冗余的猜想,仅保留对证明至关重要的猜想。
实验结果
研究问题
- RQ1在无标注数据的情况下,对形式数学表达式进行自监督语言建模是否能够实现强大的逻辑推理能力?
- RQ2是否尊重表达式结构的跳跃树训练目标在数学推理中优于标准的跳跃序列任务?
- RQ3语言模型在多大程度上能够生成新的、可证明且有用的数学猜想?
- RQ4在形式证明的背景下,如何客观衡量模型生成猜想的有用性?
主要发现
- 在跳跃树任务上训练的模型在所有推理评估任务中均优于在跳跃序列任务上训练的模型。
- 在假设预测任务中,97.75% 的模型生成语句可证明,其中 3,445 项(共 3,857 项)被用作 DeepHOL 证明中的前提。
- 在等式补全任务中,3,440 项预测中有 979 项既可证明又在证明中具有实用性。
- 在自由形式猜想生成任务中,130 项预测中有 49 项可证明且被用于证明,其中包括未出现在定理数据库中的新猜想。
- 模型发现了一条此前缺失的定理($b = a + c \Rightarrow a = b - c$),该定理被用于 1,728 个证明中,证明了其实际应用价值。
- 部分猜想,如 $\texttt{COUNTABLE}(\{s(n)\mid n\in\mathbb{N}\})$,完全为新发现,未出现在人工标注的证明或定理数据库中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。