[论文解读] Correlation versus RMSE Loss Functions in Symbolic Regression Tasks
本文提出在符号回归中使用皮尔逊相关系数(R²)作为适应度函数,替代传统的RMSE。通过在进化过程中最大化R²,并应用事后线性校准步骤,该方法在噪声或复杂基准(包括Feynman数据集)上实现了更快的收敛速度、更高的准确性,并且所需训练点更少。
The use of correlation as a fitness function is explored in symbolic regression tasks and the performance is compared against the typical RMSE fitness function. Using correlation with an alignment step to conclude the evolution led to significant performance gains over RMSE as a fitness function. Using correlation as a fitness function led to solutions being found in fewer generations compared to RMSE, as well it was found that fewer data points were needed in the training set to discover the correct equations. The Feynman Symbolic Regression Benchmark as well as several other old and recent GP benchmark problems were used to evaluate performance.
研究动机与目标
- 探究在遗传编程的符号回归中,用相关性替代RMSE作为适应度函数是否能提升性能。
- 评估基于相关性的适应度函数在多样化符号回归基准上对收敛速度和解的准确度的影响。
- 评估基于相关性的适应度函数在噪声和不同数据点数量下的鲁棒性。
- 确定在以相关性为主要适应度指标时,事后线性校准步骤是否能提升模型质量。
提出的方法
- 在遗传编程符号回归中,将标准的RMSE适应度函数替换为R²(决定系数)作为主要适应度度量。
- 在进化过程中最大化R²,以强调预测值与目标值之间线性关系的强度,且与尺度无关。
- 应用事后线性回归步骤,将进化得到的模型输出与真实目标值对齐,以最小化绝对误差:$\operatorname*{argmin}_{a_0,a_1} \sum_{i=1}^{N} |y_i - (a_1\hat{y}_i + a_0)|$。
- 使用Feynman符号回归基准和其他已建立的GP基准,评估在不同噪声水平和数据点数量下的性能。
- 在98个基准问题上,对比基于相关性的适应度函数与基于RMSE的适应度函数的结果。
- 通过收敛速度(达到解所需的代数)、解的准确度(RMSE)以及找到精确方程的成功率来衡量性能。
实验结果
研究问题
- RQ1使用相关性作为适应度函数是否相比RMSE能实现更快的符号回归收敛?
- RQ2基于相关性的适应度函数是否能以更少的训练数据点发现正确的符号方程,优于RMSE?
- RQ3在噪声条件下,基于相关性的适应度函数相比RMSE表现如何?
- RQ4事后线性校准在基于相关性适应度的模型中能多大程度上提升模型质量?
- RQ5基于相关性适应度的性能优势是否在多样化符号回归问题(包括复杂和噪声问题)中持续存在?
主要发现
- 基于相关性的适应度函数实现了显著的性能提升,在98个基准问题中成功完美求解46个——其中29个问题RMSE方法未能完美求解。
- 在200个数据点和10%噪声条件下,相关性方法在98个测试案例中有79个优于RMSE。
- 在非平凡的噪声问题(方程24–26)中,基于相关性的适应度函数表现出比RMSE更快速且更稳定的收敛特性。
- 该方法发现正确方程所需的数据点更少,表现出更高的数据效率。
- 当方程中引入常数项时,RMSE适应度函数对常数大小的敏感性显著增加,而相关性方法则保持稳健。
- 即使常数较大(如50),相关性方法仍保持强劲性能,而RMSE性能急剧下降,尤其在无噪声条件下更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。