[论文解读] GP-RVM: Genetic Programing-based Symbolic Regression Using Relevance Vector Machine
本文提出 GP-RVM,一种结合凯任编程(Kaizen Programming)与相关向量机(Relevance Vector Machine, RVM)的混合符号回归方法,用于演化稀疏、可解释的非线性模型。通过利用 RVM 从演化个体中选择并加权基函数,GP-RVM 在准确性和鲁棒性方面优于传统 GP 和 KP,且收敛速度更快、函数评估次数更少。
This paper proposes a hybrid basis function construction method (GP-RVM) for Symbolic Regression problem, which combines an extended version of Genetic Programming called Kaizen Programming and Relevance Vector Machine to evolve an optimal set of basis functions. Different from traditional evolutionary algorithms where a single individual is a complete solution, our method proposes a solution based on linear combination of basis functions built from individuals during the evolving process. RVM which is a sparse Bayesian kernel method selects suitable functions to constitute the basis. RVM determines the posterior weight of a function by evaluating its quality and sparsity. The solution produced by GP-RVM is a sparse Bayesian linear model of the coefficients of many non-linear functions. Our hybrid approach is focused on nonlinear white-box models selecting the right combination of functions to build robust predictions without prior knowledge about data. Experimental results show that GP-RVM outperforms conventional methods, which suggest that it is an efficient and accurate technique for solving SR. The computational complexity of GP-RVM scales in $O( M^{3})$, where $M$ is the number of functions in the basis set and is typically much smaller than the number $N$ of training patterns.
研究动机与目标
- 为解决传统遗传编程(GP)在符号回归中的局限性,包括代码膨胀、收敛缓慢以及搜索过程的非确定性。
- 克服凯任编程(KP)的缺点,如对 p 值阈值的依赖以及线性模型中的奇异问题。
- 开发一种确定性、稀疏且鲁棒的符号回归框架,所需先验知识极少,并确保模型的可解释性。
- 通过在基于 GP 的演化框架中整合 RVM 作为特征选择与模型估计机制,提升模型的准确性和效率。
提出的方法
- 该方法使用凯任编程(KP)的扩展版本,生成并演化一组符号表达式作为基函数。
- 与将单个个体视为完整解不同,GP-RVM 将最终模型构建为从演化个体中选择的基函数的线性组合。
- 采用相关向量机(RVM),一种稀疏贝叶斯核方法,基于基函数的预测质量与稀疏性确定其后验权重。
- RVM 框架通过使用促进模型系数稀疏性的贝叶斯先验,自动处理特征冗余与奇异问题。
- 实现了一种序列稀疏贝叶斯学习算法,以加速 RVM 训练,将计算复杂度降低至 O(M³),其中 M 为基函数数量。
- 该方法通过用 RVM 的内在模型选择替代基于 NHST 的特征选择,避免了假设检验,消除了对显著性水平阈值的需求。
实验结果
研究问题
- RQ1结合凯任编程与 RVM 的混合方法是否能在符号回归的准确性和收敛速度方面超越标准 GP 与 KP?
- RQ2在 KP 中用基于 RVM 的贝叶斯模型选择替代基于 NHST 的特征选择,是否能消除对阈值调优的需求并解决奇异问题?
- RQ3RVM 所诱导的稀疏性在多大程度上提升了模型的可解释性与在基准符号回归任务上的泛化性能?
- RQ4在函数评估次数有限的复杂非线性符号回归问题中,GP-RVM 在鲁棒性与效率方面表现如何?
主要发现
- 在两个 Keijzer 函数(keijzer 2 和 3)上,GP-RVM 达到了最高的适应度值,与 KP 并列五次,与 GP 并列两次,表明其在复杂问题上表现更优。
- 在 Keijzer 函数上,GP-RVM 所需的函数评估次数(NFEs)显著少于 GP 和 KP,尤其在复杂目标上,表明收敛更快。
- 在 Nguyen 基准测试套件(F1–F10)上,GP-RVM 在曲线拟合中实现了 100% 的成功运行率,与 KP 表现相当,同时保持了低均方根误差(RMSE)与目标评估次数。
- 测试结果表明,GP-RVM 在多个函数(keijzer 1、2、3、7、8、9)上的最大误差低于 KP,表明其在未见数据上更具鲁棒性。
- GP-RVM 的中位适应度在六个 Keijzer 函数上 ≥0.99,而 KP 为五个,GP 为四个(种群规模为 50 和 500),表明其模型质量更优。
- 该方法的计算复杂度为 O(M³),其中 M 为基函数数量,且 M 通常远小于训练样本数 N,因此保证了高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。