[论文解读] Where are we now? A large benchmark study of recent symbolic regression methods
该论文使用嵌套交叉验证在94个真实世界回归问题上对四种近期符号回归方法与十种最先进机器学习算法进行了基准测试。主要发现是基于epsilon-lexicase选择的遗传编程方法(ELLYN中的Epsilon-Lexicase)在所有数据集上的平均测试误差表现最佳,甚至优于顶尖的梯度提升模型,但其运行时间显著更长,原因在于单线程执行。
In this paper we provide a broad benchmarking of recent genetic programming approaches to symbolic regression in the context of state of the art machine learning approaches. We use a set of nearly 100 regression benchmark problems culled from open source repositories across the web. We conduct a rigorous benchmarking of four recent symbolic regression approaches as well as nine machine learning approaches from scikit-learn. The results suggest that symbolic regression performs strongly compared to state-of-the-art gradient boosting algorithms, although in terms of running times is among the slowest of the available methodologies. We discuss the results in detail and point to future research directions that may allow symbolic regression to gain wider adoption in the machine learning community.
研究动机与目标
- 评估近期符号回归(SR)方法与最先进机器学习(ML)回归算法的性能表现。
- 通过使用包含94个真实世界回归问题的大型多样化数据集,解决遗传编程(GP)中缺乏标准化基准的问题。
- 通过嵌套交叉验证实现超参数调优,提供可复现的基准框架,以实现公平比较。
- 不仅评估预测准确性,还评估SR与ML方法的计算效率(实际运行时间)。
- 通过将符号回归置于更广泛的机器学习生态中,推动其在机器学习社区中的更广泛应用。
提出的方法
- 本研究评估了四种基于GP的符号回归方法:Epsilon-Lexicase(Eplex)、多变量回归GP(MRGP)、仿射形式GP(AFP)以及采用共生选择的基因表达编程(GSGP)。
- 纳入了来自scikit-learn的十种成熟机器学习回归模型:XGBoost、梯度提升、随机森林、多层感知机(MLP)、Lasso-Lars、线性支持向量回归(Linear SVR)、随机梯度下降回归(SGD Regression)、线性回归、核岭回归和AdaBoost。
- 共收集了94个来自开源仓库的真实世界回归数据集,用于基准测试。
- 通过5折嵌套交叉验证进行超参数调优,以确保模型选择的稳健性与性能估计的无偏性。
- 性能通过训练集和测试集的均方误差(MSE)进行衡量,同时记录每种方法的实际运行时间。
- 源代码与数据集集合已公开发布,以支持可复现性及未来新方法的基准测试。
实验结果
研究问题
- RQ1在真实世界回归问题上,近期符号回归方法与最先进机器学习算法相比,其预测性能如何?
- RQ2哪些符号回归超参数设置能在多样化数据集中实现最佳泛化性能?
- RQ3符号回归方法的计算运行时间与现代机器学习算法(如XGBoost和随机森林)相比如何?
- RQ4在测试误差与模型复杂度方面,哪些符号回归技术最为有效?
- RQ5符号回归方法在多大程度上能够实现与梯度提升或集成方法相当甚至更优的性能?
主要发现
- 基于epsilon-lexicase选择的GP方法(Eplex)在全部94个数据集上的平均测试集MSE排名最高,优于XGBoost及其他高性能机器学习模型。
- 当Eplex使用100万次适应度评估时,实现了最低的平均测试误差,表明其尽管计算成本高,但具备出色的预测性能。
- MRGP与Eplex表现具有竞争力,常在多个数据集上达到或超过XGBoost与随机森林的性能。
- 所有基于GP的方法的实际运行时间显著高于机器学习方法,其中Eplex在部分数据集上的运行时间比XGBoost高出最多100倍,原因在于单线程执行。
- 各方法中频繁选择的参数设置倾向于采用较大的种群规模(如1000),以及适中的交叉/变异率;其中Eplex与AFP偏好高交叉率(0.8)与低变异率(0.2)。
- 线性回归与核岭回归表现出稳定性能,但在交叉验证中未被选为最优,表明其简单性可能不足以应对复杂回归任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。