Skip to main content
QUICK REVIEW

[论文解读] Learning concise representations for regression by evolving networks of trees

William La Cava, Tilak Raj Singh|arXiv (Cornell University)|Jul 3, 2018
Evolutionary Algorithms and Applications被引用 15
一句话总结

本文提出 FEAT 方法,通过演化表达式树网络来学习简洁、可解释的回归表示。通过将可微特征学习与基于模型权重引导的进化计算相结合,FEAT 在 100 个回归问题上均达到最先进测试性能,同时生成的模型规模比梯度提升等竞争方法小一个数量级以上。

ABSTRACT

We propose and study a method for learning interpretable representations for the task of regression. Features are represented as networks of multi-type expression trees comprised of activation functions common in neural networks in addition to other elementary functions. Differentiable features are trained via gradient descent, and the performance of features in a linear model is used to weight the rate of change among subcomponents of each representation. The search process maintains an archive of representations with accuracy-complexity trade-offs to assist in generalization and interpretation. We compare several stochastic optimization approaches within this framework. We benchmark these variants on 100 open-source regression problems in comparison to state-of-the-art machine learning approaches. Our main finding is that this approach produces the highest average test scores across problems while producing representations that are orders of magnitude smaller than the next best performing method (gradient boosting). We also report a negative result in which attempts to directly optimize the disentanglement of the representation result in more highly correlated features.

研究动机与目标

  • 开发一种可学习可解释、低复杂度回归表示的方法,使其具有良好的泛化能力。
  • 探索进化计算是否能够生成模块化、解耦的表示,从而提升模型可解释性。
  • 基准比较不同随机优化策略在学习简洁、准确表示方面的性能。
  • 探究是否通过显式优化特征解耦可提升模型可解释性与泛化能力。
  • 评估自动化特征工程中模型准确率与表示复杂度之间的权衡。

提出的方法

  • FEAT 将特征表示为多类型表达式树的网络,结合神经网络中的激活函数与基本数学运算。
  • 每个表示通过梯度下降进行训练,以优化可微特征,同时利用线性模型的模型权重引导进化过程中的变异。
  • 该算法维护一个平衡准确率与复杂度的表示档案,从而实现泛化性与可解释性。
  • 使用进化计算探索架构空间,基于模型权重的反馈对语法树应用变异算子。
  • 比较多种随机优化变体,包括进化与非进化方法,采用多目标标准进行评估。
  • 通过在线性模型拟合演化特征进行模型选择,特征重要性由学习到的系数大小决定。

实验结果

研究问题

  • RQ1通过演化表达式树网络是否能够生成既高度准确又显著比最先进方法更简洁的回归模型?
  • RQ2在进化过程中使用模型权重作为反馈是否能提升所学表示的质量?
  • RQ3是否通过显式优化特征解耦或低相关性可提升可解释性与泛化能力?
  • RQ4不同随机优化策略在学习紧凑、准确的回归表示方面表现如何比较?
  • RQ5模型选择过程在多大程度上会偏好高度相关的特征,即使多重共线性已被惩罚?

主要发现

  • FEAT 在 100 个开源回归问题上的平均测试 R² 得分最高,优于包括 XGBoost、随机森林和 ElasticNet 在内的最先进方法。
  • FEAT 生成的最终模型规模比梯度提升方法小一个数量级以上,中位数模型规模为 12 个节点,而 XGBoost 模型超过 1,000 个节点。
  • 在优化过程中显式最小化特征相关性(通过 FeatCorr 和 FeatCN)并未降低最终表示的相关性,甚至在某些情况下增加了相关性,与假设‘此类目标可提升解耦性’相矛盾。
  • FEAT 最终选择的模型常组合使用非线性、多项式及交互特征(例如:tanh(x₁)、x₁·x₀·(x₃−x₀)),展现出从简单到更精确表示的可解释性与复杂度递进过程。
  • FEAT 与 MLP 的特征空间高度相关,但 FEAT 的表示表现出比 MLP 更多的双变量相关性,表明尽管有优化目标,仍存在特征冗余的倾向。
  • 模型选择过程依赖验证误差与系数大小,可能无意中偏好高度相关的表示,因为多重共线性虽影响标准误,但未必影响预测性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。