[论文解读] Neural Symbolic Regression that Scales
一个基于 Transformer 的符号回归器,事先在数百万个生成的方程上进行预训练,随后从输入-输出对预测方程骨架并拟合常数,从而实现可扩展、数据驱动的符号回归,随着数据和计算量增加而改进。
Symbolic equations are at the core of scientific discovery. The task of discovering the underlying equation from a set of input-output pairs is called symbolic regression. Traditionally, symbolic regression methods use hand-designed strategies that do not improve with experience. In this paper, we introduce the first symbolic regression method that leverages large scale pre-training. We procedurally generate an unbounded set of equations, and simultaneously pre-train a Transformer to predict the symbolic equation from a corresponding set of input-output-pairs. At test time, we query the model on a new set of points and use its output to guide the search for the equation. We show empirically that this approach can re-discover a set of well-known physical equations, and that it improves over time with more data and compute.
研究动机与目标
- 将符号回归作为数据驱动、可扩展的替代传统手工设计方法。
- 引入使用生成方程的大规模预训练框架。
- 学习一个参数化的符号回归器,从输入-输出数据预测方程骨架。
- 评估预训练规模、测试时计算量、以及数据点数量如何影响性能。
- 展示在多个符号回归基准上的可扩展性和鲁棒性。
提出的方法
- 预训练一个 Transformer,将一组输入-输出对映射到一个方程骨架(常数占位符)。
- 将方程表示为前缀表示法,并使用一个用于后续拟合常数的占位符符号。
- 在数亿个通过程序生成的方程上进行训练,以学习符号表达式的先验。
- 测试时,对给定数据进行编码,通过束搜索采样骨架候选,并使用非线性优化器(如 BFGS)拟合常数。
- 使用 Set Transformer 编码器处理可变大小输入集合的置换不变性;使用标准 Transformer 解码器进行解码。
- 通过在各种数据集(AIF、SOOSE、Nguyen)上将预测方程与真实值进行比较,使用分布内和分布外指标进行评估。
实验结果
研究问题
- RQ1符号回归器能否通过大规模预训练学习,超过手工设计的符号回归方法?
- RQ2预训练数据规模如何影响测试时的符号回归性能?
- RQ3该方法是否随输入-输出对数量和输入变量数量的增加而扩展?
- RQ4在分布内与分布外的方程集合上的表现如何?
- RQ5测试时计算量与准确性之间的权衡是什么?
主要发现
- NeSymReS 随着预训练数据增加而提升,在相似计算预算下,在不同数据集上超越最先进的基线。
- 测试时,NeSymReS 以较少的计算量取得更高的精度,相较于基线,尤其在 AI-Feynman (AIF) 上。
- 随着更多测试时输入-输出对,性能提升;数据点数量变化时保持鲁棒。
- 由于 Set Transformer 设计,该方法在输入-输出点数量和输入维度上呈线性扩展。
- 在大型方程分布上的预训练使模型能够泛化到未见过的方程(SOOSE)和更长的表达式。
- NeSymReS 在 CPU 上在可比精度下可以快得多(数量级级)比基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。