[论文解读] Exhaustive Symbolic Regression
本文提出了一种确定性方法——全面符号回归(ESR),系统性地评估所有可能的符号表达式,直至给定复杂度,使用预定义的运算符集合,确保发现最优函数。通过将准确性和简洁性结合到单一目标中的最小描述长度原理,ESR 消除了主观的模型选择,并识别出40多个函数,其对宇宙时钟和超新星数据的拟合比弗里德曼方程更经济,挑战了标准宇宙学模型的唯一性。
Symbolic Regression (SR) algorithms attempt to learn analytic expressions which fit data accurately and in a highly interpretable manner. Conventional SR suffers from two fundamental issues which we address here. First, these methods search the space stochastically (typically using genetic programming) and hence do not necessarily find the best function. Second, the criteria used to select the equation optimally balancing accuracy with simplicity have been variable and subjective. To address these issues we introduce Exhaustive Symbolic Regression (ESR), which systematically and efficiently considers all possible equations -- made with a given basis set of operators and up to a specified maximum complexity -- and is therefore guaranteed to find the true optimum (if parameters are perfectly optimised) and a complete function ranking subject to these constraints. We implement the minimum description length principle as a rigorous method for combining these preferences into a single objective. To illustrate the power of ESR we apply it to a catalogue of cosmic chronometers and the Pantheon+ sample of supernovae to learn the Hubble rate as a function of redshift, finding $\sim$40 functions (out of 5.2 million trial functions) that fit the data more economically than the Friedmann equation. These low-redshift data therefore do not uniquely prefer the expansion history of the standard model of cosmology. We make our code and full equation sets publicly available.
研究动机与目标
- 为解决传统符号回归(SR)的随机性问题,该问题可能导致因随机搜索而遗漏最优函数。
- 解决 SR 中将准确性和简洁性结合时存在的主观且不一致的模型选择标准。
- 开发一种对所有可能符号表达式在给定复杂度范围内的确定性、全面搜索方法,以保证找到真正的帕累托前沿。
- 应用严格的、基于信息论的标准——最小描述长度(MDL)——将帕累托前沿压缩为单一最优模型排序。
- 通过从宇宙学数据中发现哈勃参数关于红移的替代函数形式,展示该方法的强大能力。
提出的方法
- ESR 对由预定义运算符集合(例如 +, *, sqrt, exp)构成的所有可能符号表达式进行完整、系统性的枚举,直至指定的最大树复杂度(节点数)。
- 通过树拓扑约束和代数简化,消除重复或等价的函数,使搜索空间相比朴素枚举缩小约1400倍。
- 对每个唯一函数,执行所有自由参数的完整数值优化,以实现对数据的最佳拟合。
- 应用最小描述长度(MDL)原理,计算一个综合模型拟合(对数似然)和模型复杂度(参数复杂度和结构复杂度)的单一目标得分。
- MDL 得分基于负对数似然之和与基于费舍尔信息矩阵及参数数量的惩罚项推导得出,从而实现对所有候选函数的一维排序。
- 该方法已实现为开源代码,并应用于两个宇宙学数据集:宇宙时钟和 Pantheon+ 超新星样本。
实验结果
研究问题
- RQ1对符号表达式进行确定性、全面搜索,是否能保证在给定数据集和复杂度限制下发现全局最优函数?
- RQ2最小描述长度原理是否提供比现有启发式标准更严格、更客观的准确性与简洁性结合方法?
- RQ3是否存在哈勃参数关于红移的替代函数形式,其对低红移宇宙学数据的拟合比弗里德曼方程更经济?
- RQ4目前的宇宙学数据在多大程度上唯一支持标准模型的膨胀历史?
- RQ5ESR 是否可用于发现物理上可解释的、解析表达式,其在数据拟合方面优于传统模型,同时保持可解释性?
主要发现
- 基于 MDL 准则,ESR 从 520 万个候选表达式中识别出 40 个函数,其对宇宙时钟和 Pantheon+ 超新星数据的拟合优于弗里德曼方程。
- 该方法保证找到准确性和复杂性之间最优权衡的真实帕累托前沿,消除了因随机搜索而遗漏最佳解的风险。
- 通过应用最小描述长度原理,ESR 提供了所有候选函数的单一、客观排序,解决了从帕累托前沿中选择的模糊性。
- 代码和生成的所有方程集已公开发布于 https://github.com/DeaglanBartlett/ESR,支持可复现性和再利用。
- 结果表明,低红移宇宙学数据并不唯一偏好标准模型的膨胀历史,因为多个替代解析形式在 MDL 准则下表现同样或更优。
- ESR 框架具有通用性,已在一篇配套论文中用于发现星系动力学中径向加速度关系的函数形式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。