Skip to main content
QUICK REVIEW

[论文解读] LIME: Learning Inductive Bias for Primitives of Mathematical Reasoning

Yuhuai Wu, Markus N. Rabe|arXiv (Cornell University)|Jan 15, 2021
Neural Networks and Applications参考文献 51被引用 9
一句话总结

该论文提出 LIME,一种新颖的预训练方法,通过在受皮尔士推理原语(演绎、归纳、溯因)启发的三种合成任务上训练变换器,编码数学推理的归纳偏置。该方法以极低的计算成本在四个数学推理基准上实现显著性能提升,优于原始变换器,并展现出向非变换器架构(如LSTM)的迁移能力。

ABSTRACT

While designing inductive bias in neural architectures has been widely studied, we hypothesize that transformer networks are flexible enough to learn inductive bias from suitable generic tasks. Here, we replace architecture engineering by encoding inductive bias in the form of datasets. Inspired by Peirce's view that deduction, induction, and abduction are the primitives of reasoning, we design three synthetic tasks that are intended to require the model to have these three abilities. We specifically design these tasks to be synthetic and devoid of mathematical knowledge to ensure that only the fundamental reasoning biases can be learned from these tasks. This defines a new pre-training methodology called "LIME" (Learning Inductive bias for Mathematical rEasoning). Models trained with LIME significantly outperform vanilla transformers on four very different large mathematical reasoning benchmarks. Unlike dominating the computation cost as traditional pre-training approaches, LIME requires only a small fraction of the computation cost of the typical downstream task. The code for generating LIME tasks is available at https://github.com/tonywu95/LIME.

研究动机与目标

  • 探究是否可以通过在合成数据集上预训练而非通过网络架构设计来学习数学推理的归纳偏置。
  • 解决传统预训练方法主导下游计算成本且依赖大规模自然语言语料的局限性。
  • 探究通过合成任务学习推理原语(演绎、归纳、溯因)是否能提升在数学推理基准上的泛化能力。
  • 解耦预训练的贡献——内容知识与归纳偏置,尤其在推理任务背景下。
  • 证明即使不加载词嵌入或输出层权重,预训练仍可有效,从而实现跨词汇的迁移。

提出的方法

  • 设计三种对应于皮尔士三种推理原语的合成任务:演绎(从前提推导结论)、归纳(从示例中泛化规则)、溯因(从证据和规则推断解释)。
  • 构建不包含数学知识的任务,仅关注逻辑结构,以确保模型学习到基本的推理归纳偏置。
  • 使用极低计算量(单张GPU上约两小时)对标准变换器模型在这些合成任务上进行预训练。
  • 将同一预训练模型应用于多种下游数学推理基准,无需重新初始化嵌入层或输出层。
  • 通过课程学习原则,先教授基础推理技能,再在特定领域任务上进行微调。
  • 在四个基准上评估性能:IsarStep、HOList Skip-tree、MetaMathStep 和 LeanStep,与从零开始训练的模型及标准预训练基线进行比较。

实验结果

研究问题

  • RQ1是否能通过合成数据集而非架构修改来有效编码数学推理的归纳偏置?
  • RQ2在模拟演绎、归纳和溯因的合成推理任务上进行预训练,是否能带来下游数学推理性能的可测量提升?
  • RQ3LIME 预训练是否能以传统预训练方法计算成本的一小部分实现显著性能增益?
  • RQ4LIME 的优势是否可迁移至非变换器架构,如LSTM?
  • RQ5LIME 的性能提升在多大程度上源于学习归纳偏置,而非记忆预训练数据中的内容?

主要发现

  • 在 IsarStep 上,LIME 预训练将 top-1 准确率从 20.4% 提升至 26.9%,相对提升 31.9%。
  • 在 LeanStep 上,LIME 将 top-1 准确率从 15.5% 提升至 29.8%,相对提升 92.3%。
  • 该方法仅需在单张 GPU 上训练约两小时,计算成本远低于下游任务的计算开销。
  • 微调时加载词嵌入或输出层权重并未显著提升性能,表明模型学习的是通用归纳偏置而非特定任务知识。
  • LIME 同样提升了 LSTM 的性能,尽管增益较小——普通 LSTM 的 top-1 准确率从 5.5% 提升至 6.9%,带注意力的 LSTM 从 12.3% 提升至 13.4%,凸显变换器在从合成任务中学习方面更强的能力。
  • 结果表明,变换器架构足够灵活,可通过数据设计学习到强归纳偏置,支持了‘归纳偏置可通过数据而非架构编码’的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。