[论文解读] SymFormer: End-to-end symbolic regression using transformer-based architecture
SymFormer 提出了一种基于 Transformer 的端到端符号回归架构,能够在单次前向传播中联合预测符号表达式和数值常数,显著提升了拟合精度和推理速度,优于以往方法。通过将学习到的常数与基于梯度的微调相结合,其在基准数据集上实现了 SOTA 性能,R² 为 1.0000,相对误差为 0.0010。
Many real-world problems can be naturally described by mathematical formulas. The task of finding formulas from a set of observed inputs and outputs is called symbolic regression. Recently, neural networks have been applied to symbolic regression, among which the transformer-based ones seem to be the most promising. After training the transformer on a large number of formulas (in the order of days), the actual inference, i.e., finding a formula for new, unseen data, is very fast (in the order of seconds). This is considerably faster than state-of-the-art evolutionary methods. The main drawback of transformers is that they generate formulas without numerical constants, which have to be optimized separately, so yielding suboptimal results. We propose a transformer-based approach called SymFormer, which predicts the formula by outputting the individual symbols and the corresponding constants simultaneously. This leads to better performance in terms of fitting the available data. In addition, the constants provided by SymFormer serve as a good starting point for subsequent tuning via gradient descent to further improve the performance. We show on a set of benchmarks that SymFormer outperforms two state-of-the-art methods while having faster inference.
研究动机与目标
- 解决现有神经符号回归模型仅生成公式而缺乏数值常数所带来的拟合次优问题。
- 通过训练 Transformer 模型在推理过程中联合预测符号表达式和具体常数值,提升符号回归性能。
- 通过使用预测的常数作为局部梯度下降优化的初始化点,提升模型泛化能力和拟合精度。
- 验证一种新型常数编码策略的有效性,该策略可改善符号生成中的注意力机制和序列建模。
- 为真实世界科学与工程应用提供快速、准确且可泛化的符号回归方法。
提出的方法
- 在包含数亿个符号公式的大型数据集上,端到端训练基于 Transformer 的架构。
- 模型在单个自回归序列中同时生成符号标记(例如 '+'、'sin'、'x')和数值常数,使用包含常数占位符的修改版标记词汇表。
- 提出一种新颖的“扩展编码”策略,通过取对数和指数变换(例如,将 'a^x' 表示为 'exp(x * ln(a))')来提升数值稳定性,并增强模型对常数的注意力机制。
- 将预测的常数用作 BFGS 或梯度下降优化的初始化点,通过局部优化进一步微调最终公式,以最小化观测数据上的均方误差。
- 利用注意力机制使符号生成条件依赖于先前预测的常数,从而实现更连贯、更准确的表达式构建。
- 采用两阶段推理流程:首先,模型生成带常数的候选公式;其次,通过基于梯度的优化进一步调整常数,以最小化观测数据上的均方误差。
实验结果
研究问题
- RQ1与分别预测常数的模型相比,在推理过程中联合预测符号表达式和数值常数是否能提升符号回归的准确性?
- RQ2对常数使用对数和指数变换是否能提升符号生成中的模型性能和数值稳定性?
- RQ3使用预测常数作为初始化点的基于梯度的微调,对最终模型精度和收敛速度有何影响?
- RQ4与标准常数表示相比,所提出的扩展编码策略在符号 Transformer 中对注意力机制和序列建模的提升程度如何?
- RQ5在性能和推理速度方面,SymFormer 与 SOTA 符号回归方法相比表现如何,特别是在基准数据集上的 R² 和相对误差方面?
主要发现
- SymFormer 在基准数据集上使用 Top-K 采样(K=20)和 256 个样本时,实现了 R² = 1.0000 和相对误差 = 0.0010,显著优于以往方法。
- 消融实验证实,训练过程中预测常数可提升性能:带常数预测的基线编码(R² = 0.9979,误差 = 0.0669)优于无常数模型(R² = 0.9929,误差 = 0.1547)。
- 结合梯度微调的扩展编码策略取得最佳结果(R² = 1.0000,误差 = 0.0010),表明合理的常数表示可增强模型泛化能力和注意力机制。
- SymFormer 的推理速度显著快于进化方法,推理时间在秒级量级,适用于实时应用。
- 模型展现出强大的外推能力,在分布外测试中表现良好,验证了其泛化能力。
- 定性分析表明,SymFormer 可从数据中恢复复杂数学关系(例如,类似傅里叶的分解),表明其在多样化公式上预训练所形成的强归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。