[论文解读] Neural-Guided Symbolic Regression with Asymptotic Constraints
该论文提出了一种带有渐近约束的神经网络引导符号回归方法,该方法利用条件神经网络生成针对 x→0 和 x→∞ 时期望的首项多项式幂的生成规则,并将其整合进神经网络引导的蒙特卡洛树搜索(NG-MCTS),以高效探索庞大的符号空间。该方法在数千个任务中实现了 71% 的成功率,搜索空间超过 10^50,显著优于先前的方法。
Symbolic regression is a type of discrete optimization problem that involves searching expressions that fit given data points. In many cases, other mathematical constraints about the unknown expression not only provide more information beyond just values at some inputs, but also effectively constrain the search space. We identify the asymptotic constraints of leading polynomial powers as the function approaches zero and infinity as useful constraints and create a system to use them for symbolic regression. The first part of the system is a conditional production rule generating neural network which preferentially generates production rules to construct expressions with the desired leading powers, producing novel expressions outside the training domain. The second part, which we call Neural-Guided Monte Carlo Tree Search, uses the network during a search to find an expression that conforms to a set of data points and desired leading powers. Lastly, we provide an extensive experimental validation on thousands of target expressions showing the efficacy of our system compared to exiting methods for finding unknown functions outside of the training set.
研究动机与目标
- 为解决在传统方法难以扩展的大规模、指数增长的表达式空间中进行符号回归的挑战。
- 将 x→0 和 x→∞ 时的渐近约束作为语义先验,以指导搜索并提升泛化能力。
- 开发一种神经网络,根据期望的首项多项式幂生成有效的生成规则,从而实现对训练数据之外情况的泛化。
- 设计一种神经网络引导的蒙特卡洛树搜索(NG-MCTS),利用神经模型对表达式搜索进行概率引导,以同时实现数据拟合和渐近约束满足。
- 在数千个目标表达式上进行实证验证,证明该方法在插值和外推任务中均表现优异。
提出的方法
- 训练一个条件生成规则的神经网络,根据指定的 x→0 和 x→∞ 时的首项幂预测有效的语法生成规则。
- 神经网络学习在渐近行为条件下对语法上有效的表达式进行分布建模,从而实现对未见首项幂的泛化。
- 神经网络引导的蒙特卡洛树搜索(NG-MCTS)利用神经模型为有希望的表达式路径分配更高的概率,以指导树的扩展。
- NG-MCTS 算法通过使用神经策略得分来优先选择可能产生匹配数据和渐近约束的表达式的搜索树节点,实现探索与利用的平衡。
- 该系统将符号回归与神经引导相结合,实现了对表达式空间大小超过 10^50 的高效遍历。
- 该方法支持插值(拟合训练数据)和外推(推广到未见输入),性能通过均方根误差(RMSE)和首项幂偏差进行衡量。
实验结果
研究问题
- RQ1x→0 和 x→∞ 时的渐近约束能否有效用作语义先验,以指导大规模表达式空间中的符号回归?
- RQ2神经网络能否泛化至生成训练期间未见过的首项幂的有效生成规则?
- RQ3将神经引导整合进蒙特卡洛树搜索是否能显著提升符号回归性能,相比基线方法?
- RQ4所提出的 NG-MCTS 方法在外推任务中的表现如何,特别是在超出训练域范围的泛化能力方面?
- RQ5训练数据中的噪声对 NG-MCTS 系统的鲁棒性和泛化能力有何影响?
主要发现
- NG-MCTS 在数千个符号回归任务中实现了 71% 的成功率,而表现最好的基线方法仅为 23%。
- 该方法成功解决了表达式空间大小超过 10^50 的问题,证明了其在极大规模搜索空间中的可扩展性。
- 在含噪声的训练环境中,NG-MCTS 保持了最低的中位外推误差(Δg_ext. = 0.256)和零中位首项幂偏差(ΔP[g] = 0),表明其具有强大的鲁棒性。
- 条件生成规则神经网络在未见首项幂上表现出有效的泛化能力,表现为能够生成训练分布之外的新颖且有效的表达式。
- NG-MCTS 显著优于标准 MCTS 和进化算法(EA),尤其在外推任务和使用渐近约束时表现更优。
- 即使在含噪声的训练数据下,NG-MCTS 仍保持了卓越性能,其中位外推误差比其他方法低 3–4 倍,且实现了零中位首项幂误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。