[论文解读] A divide and conquer method for symbolic regression
本文提出了一种用于符号回归的分治(D&C)方法,通过利用函数可分性来加速遗传编程(GP)。通过使用一种新颖的双相关性检验(BiCT)检测可分的子函数,该方法将复杂的目标函数分解为更简单的组成部分,从而实现更快的收敛速度——在真实应用场景中将计算时间降低几个数量级,同时保持通用性。
Symbolic regression aims to find a function that best explains the relationship between independent variables and the objective value based on a given set of sample data. Genetic programming (GP) is usually considered as an appropriate method for the problem since it can optimize functional structure and coefficients simultaneously. However, the convergence speed of GP might be too slow for large scale problems that involve a large number of variables. Fortunately, in many applications, the target function is separable or partially separable. This feature motivated us to develop a new method, divide and conquer (D&C), for symbolic regression, in which the target function is divided into a number of sub-functions and the sub-functions are then determined by any of a GP algorithm. The separability is probed by a new proposed technique, Bi-Correlation test (BiCT). D&C powered GP has been tested on some real-world applications, and the study shows that D&C can help GP to get the target function much more rapidly.
研究动机与目标
- 为解决大规模符号回归问题中涉及多个变量时遗传编程(GP)收敛缓慢的问题。
- 利用真实函数中常见的可分性或部分可分性结构特征,提升优化效率。
- 开发一种系统化方法,将复杂函数分解为子函数,实现独立的GP优化。
- 提出一种新的可分性检测技术——双相关性检验(BiCT),以识别适合分解的变量分组。
- 证明D&C方法在保持通用性的同时,显著降低符号回归的计算成本。
提出的方法
- 该方法基于检测到的可分性将目标函数分解为子函数,并通过GP独立处理每个子函数。
- 提出一种新技术——双相关性检验(BiCT),用于检测目标函数中变量子集是否具有可分性或部分可分性。
- 子函数通过解析矩阵进化(PME)进行优化,PME是一种使用整数字符串表示程序的GP变体,可实现高效搜索。
- 整体模型由优化后的子函数重构,计算成本通过复杂度模型(公式15)进行估算。
- 可分性通过数学公式定义,即函数被表示为在互不相交变量子集上的子函数复合形式。
- 该方法应用于气体动力学中的真实方程,验证了其效率与准确性。
实验结果
研究问题
- RQ1是否能够在符号回归问题中可靠检测函数可分性,以实现高效分解?
- RQ2当目标函数被分解为可分子函数时,符号回归的收敛速度能提升多少?
- RQ3分治方法是否在显著降低计算成本的同时保持符号回归的通用性?
- RQ4双相关性检验(BiCT)在识别可分变量组方面相较于传统方法的优越程度如何?
- RQ5D&C方法是否能比标准GP更高效地从真实工程数据中恢复精确或近似精确的符号表达式?
主要发现
- 对于一个2变量的符号回归问题(公式1),D&C方法将CPU时间从12分钟26秒减少至11.2秒,速度提升约67倍。
- 对于一个5变量问题(公式2),D&C方法仅耗时18.3秒,而无D&C的GP耗时85分钟43秒,速度提升超过280倍。
- 双相关性检验(BiCT)在两个测试案例中均成功识别出可分变量组,实现了准确的分解。
- 即使标准GP未能恢复精确的符号形式,D&C方法仍能始终生成拟合误差为零(1−R²=0.0)的模型,且在双精度下表现准确。
- D&C方法的计算复杂度估算为O(10⁷),显著低于完整GP方法的O(10¹⁰),证实了其具有数量级级别的性能提升。
- 该方法在保持高精度和通用性的同时,成功恢复了两个测试案例中的精确符号形式,包括非线性和非可分组合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。