Skip to main content
QUICK REVIEW

[论文解读] Elite Bases Regression: A Real-time Algorithm for Symbolic Regression

Chen Chen, Changtong Luo|arXiv (Cornell University)|Apr 24, 2017
Evolutionary Algorithms and Applications参考文献 14被引用 6
一句话总结

本文提出精英基回归(Elite Bases Regression, EBR),一种实时、非演化型符号回归算法,通过迭代保留并更新相关性最高的基函数(基于相关系数选择),同时丢弃其余基函数,从而加速模型发现。与FFX相比,EBR在更低的归一化均方误差(NMSE)下实现更简洁的模型,且因避免求解大规模线性系统而计算更快。

ABSTRACT

Symbolic regression is an important but challenging research topic in data mining. It can detect the underlying mathematical models. Genetic programming (GP) is one of the most popular methods for symbolic regression. However, its convergence speed might be too slow for large scale problems with a large number of variables. This drawback has become a bottleneck in practical applications. In this paper, a new non-evolutionary real-time algorithm for symbolic regression, Elite Bases Regression (EBR), is proposed. EBR generates a set of candidate basis functions coded with parse-matrix in specific mapping rules. Meanwhile, a certain number of elite bases are preserved and updated iteratively according to the correlation coefficients with respect to the target model. The regression model is then spanned by the elite bases. A comparative study between EBR and a recent proposed machine learning method for symbolic regression, Fast Function eXtraction (FFX), are conducted. Numerical results indicate that EBR can solve symbolic regression problems more effectively.

研究动机与目标

  • 解决遗传编程(GP)在大规模问题中符号回归时收敛缓慢且不可重复的问题。
  • 克服FFX的计算瓶颈,其在路径正则化过程中需求解大规模线性系统。
  • 开发一种确定性、实时的符号回归方法,平衡模型准确性、简洁性与计算速度。
  • 通过减少计算时间和内存使用,实现符号回归在工程和数据分析中的实际部署。

提出的方法

  • 通过特定映射规则将候选基函数编码为解析矩阵,系统生成符号表达式。
  • 利用基函数与目标函数之间的相关系数评估每个候选基,以排序其相关性。
  • 在每次迭代中仅保留最相关的前n个基函数(精英基),其余全部丢弃,以降低计算负载。
  • 通过广义线性模型(GLM)拟合,将最终回归模型构建为精英基的线性组合。
  • 通过仅关注精英基来避免求解大规模线性系统,从而实现实时性能。
  • 使用控制参数 $ n_{presv} $ 调节保留的精英基数量,平衡准确性与效率。

实验结果

研究问题

  • RQ1非演化型符号回归方法能否在保持准确性的前提下,实现比GP更快的收敛速度?
  • RQ2消除求解大规模线性系统的需要,能否提升符号回归中的实时性能?
  • RQ3仅选择最相关基函数是否能产生比完整基枚举更简洁、更准确的模型?
  • RQ4在基准问题上,EBR与FFX在模型简洁性、NMSE和计算成本方面有何对比?
  • RQ5精英基数量($ n_{presv} $)对模型准确性与计算效率有何影响?

主要发现

  • 在所有测试案例中,EBR的归一化均方误差(NMSE)显著低于FFX,多个案例中NMSE值持续低于1%。
  • EBR生成的回归模型比FFX更简洁,使用的基函数更少——例如,案例24中EBR使用14个基函数,而FFX使用16个,且误差更低。
  • 对于高度非线性函数(如案例17、21、24),EBR在模型简洁性与准确性方面均优于FFX,表明其在结构优化方面表现更优。
  • 当 $ n_{presv} = 35 $ 时,EBR在复杂的一维和二维非线性模型上无法实现NMSE ≤ 5%,但将 $ n_{presv} $ 增加至200后,可实现高精度近似,且基函数数量更高。
  • 即使使用更多基函数,EBR仍保持比FFX更低的NMSE,证明其在捕捉复杂函数形式方面具有更强的鲁棒性与有效性。
  • EBR通过避免求解大规模线性系统,实现实时计算,适用于实际的时间敏感型应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。