Skip to main content
QUICK REVIEW

[论文解读] Symbolic Regression for Space Applications: Differentiable Cartesian Genetic Programming Powered by Multi-objective Memetic Algorithms

Marcus Märtens, Dario Izzo|arXiv (Cornell University)|Jun 13, 2022
Evolutionary Algorithms and Applications被引用 4
一句话总结

该论文提出了一种基于可微分卡氏遗传编程(dCGP)的多目标记忆算法,用于演化可解释的符号回归模型,同时在进化过程中学习数值常数。该方法在两项太空应用——火星快车号热功率估计和恒星年龄预测中,性能优于或匹配当前最先进机器学习模型,且生成的数学表达式具有可解释性,即使在数据稀疏的情况下也表现出良好的泛化能力。

ABSTRACT

Interpretable regression models are important for many application domains, as they allow experts to understand relations between variables from sparse data. Symbolic regression addresses this issue by searching the space of all possible free form equations that can be constructed from elementary algebraic functions. While explicit mathematical functions can be rediscovered this way, the determination of unknown numerical constants during search has been an often neglected issue. We propose a new multi-objective memetic algorithm that exploits a differentiable Cartesian Genetic Programming encoding to learn constants during evolutionary loops. We show that this approach is competitive or outperforms machine learned black box regression models or hand-engineered fits for two applications from space: the Mars express thermal power estimation and the determination of the age of stars by gyrochronology.

研究动机与目标

  • 解决黑箱机器学习模型在关键太空应用中可解释性不足的问题。
  • 克服符号回归在进化过程中难以学习数值常数的局限性。
  • 开发一种方法,能从稀疏数据中自动发现准确、简洁且可解释的数学表达式。
  • 通过利用具有物理解释意义的代数结构,在太空科学中实现跨领域差距的泛化。
  • 提供一种决策支持工具,通过多目标优化平衡模型准确率与复杂度。

提出的方法

  • 该方法采用可微分卡氏遗传编程(dCGP),将数学表达式编码为具有可微节点的有向无环图。
  • 表达式中的数值常数通过在进化循环中进行基于梯度的优化来学习,从而实现对系数的精确调优。
  • 多目标记忆算法(MOMES)结合了进化搜索与局部搜索启发式方法,以同时优化模型准确率与表达式复杂度。
  • 该算法维护一个非支配解集,使可解释性与性能之间的权衡关系得以可视化和选择。
  • 对dCGP基因型应用进化算子(如变异和交叉),同时在每代中使用梯度下降法优化常数。
  • 最终表达式在测试集上进行评估,并与标准机器学习模型(如神经网络、高斯过程和随机森林)的性能进行比较。

实验结果

研究问题

  • RQ1可微分CGP能否在符号回归过程中有效学习数值常数,从而提升模型准确率?
  • RQ2所提出的多目标记忆算法在符号表达式中如何平衡准确率与可解释性?
  • RQ3dCGP模型能否在太空科学应用中(如恒星年龄估计)实现跨领域差距的泛化?
  • RQ4进化出的符号表达式是否能揭示黑箱模型所忽略的数据结构特征或潜在过拟合现象?
  • RQ5dCGP模型在真实世界太空数据集上的性能与当前最先进机器学习模型相比如何?

主要发现

  • 在火星快车号热功率估计基准测试中,dCGP的平均绝对误差(MAE)为0.41,优于线性回归,并与最佳性能模型持平。
  • 在恒星年龄预测基准B1中,dCGP的MAE为1.41,优于大多数机器学习模型,并在跨领域差距下表现出强大的泛化能力。
  • 在基准B2中,一个简单表达式 $x_6 - \sin(x_1 - x_4) + 6.987$ 的MAE为1.39,优于所有其他模型,包括神经网络和高斯过程。
  • Pareto前沿分析表明,dCGP表达式在可解释性方面始终优于黑箱模型,且在数据稀缺场景下更不易过拟合。
  • 在B2基准中,训练误差与测试误差之间的相关性较低,表明该简单表达式的表现可能反映了真正的泛化能力而非过拟合。
  • 在基准C中,最佳dCGP表达式的MAE为15.63,仅次于高斯过程,显示出在具有挑战性的数据集上的强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。