[论文解读] Rethinking Symbolic Regression Datasets and Benchmarks for Scientific Discovery
本文提出了一套用于科学发现的符号回归(SRSD)的新基准数据集,包含从《费曼物理学讲义》中提取的120个真实数据集,其变量取值范围具有物理意义,同时提出归一化编辑距离(NED)作为评估方程相似性的更优指标。实验表明,现有SR方法在新基准上的表现显著低于在以往数据集上的表现,凸显了对更鲁棒的SRSD方法的迫切需求。
This paper revisits datasets and evaluation criteria for Symbolic Regression (SR), specifically focused on its potential for scientific discovery. Focused on a set of formulas used in the existing datasets based on Feynman Lectures on Physics, we recreate 120 datasets to discuss the performance of symbolic regression for scientific discovery (SRSD). For each of the 120 SRSD datasets, we carefully review the properties of the formula and its variables to design reasonably realistic sampling ranges of values so that our new SRSD datasets can be used for evaluating the potential of SRSD such as whether or not an SR method can (re)discover physical laws from such datasets. We also create another 120 datasets that contain dummy variables to examine whether SR methods can choose necessary variables only. Besides, we propose to use normalized edit distances (NED) between a predicted equation and the true equation trees for addressing a critical issue that existing SR metrics are either binary or errors between the target values and an SR model's predicted values for a given input. We conduct benchmark experiments on our new SRSD datasets using various representative SR methods. The experimental results show that we provide a more realistic performance evaluation, and our user study shows that the NED correlates with human judges significantly more than an existing SR metric. We publish repositories of our code and 240 SRSD datasets.
研究动机与目标
- 为科学发现中的符号回归解决缺乏真实、物理基础的数据集的问题。
- 克服现有评估指标的局限性,即对结构不同但数值相近的方程同等对待。
- 构建一个更能反映现实世界科学发现挑战的基准,包括变量范围的真实性与抗噪声能力。
- 在更具挑战性、更真实的数据集和指标上评估最先进SR方法的性能。
- 为未来SRSD研究提供可复现的基准,包含代码与数据集。
提出的方法
- 从《费曼物理学讲义》中的公式重新创建120个符号回归数据集,基于公式特性仔细定义具有物理合理性的变量取值范围。
- 设计第二组120个数据集,引入虚拟变量,以测试SR方法的变量选择能力。
- 提出方程树之间的归一化编辑距离(NED)作为定量指标,用于评估预测方程与真实方程之间的结构相似性。
- 使用sympy计算基于树的编辑距离,以确保符号表达式的一致解析与比较。
- 在目标变量中注入高斯噪声,噪声水平为γ ∈ {0, 10⁻³, 10⁻², 10⁻¹},以评估在真实世界噪声条件下的鲁棒性。
- 在六个SR基线方法上开展基准实验,使用新数据集与NED指标评估性能。
实验结果
研究问题
- RQ1现有符号回归方法能否成功从具有真实变量范围的数据集中恢复物理定律,而非仅在人为受限的条件下?
- RQ2所提出的归一化编辑距离(NED)与人类对方程相似性的判断相比,相较于现有指标是否具有更强的相关性?
- RQ3当面对真实物理变量范围和噪声时,SR方法在多大程度上会无法发现正确方程?
- RQ4在数据集中引入虚拟变量是否能有效测试方法的变量选择能力?
- RQ5新SRSD基准与先前的FSRD基准在解的准确率和NED得分上表现如何比较?
主要发现
- 新SRSD基准数据集相较于FSRD基准显著降低了求解率,最佳方法的求解率从52.65%下降至9.17%。
- 归一化编辑距离(NED)与人类判断的相关性显著高于以往基准中使用的标准求解率指标。
- 噪声注入使所有方法的NED得分均上升,证实新基准能够捕捉到如测量误差等现实世界挑战。
- 在新基准上,各方法之间的性能差距更加显著,表明当前SR方法在真实科学发现任务中仍存在困难。
- 所提出的NED指标相较于仅使用二元求解率或预测误差,能提供更细致、更具信息量的符号回归性能评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。