Skip to main content
QUICK REVIEW

[论文解读] RoNGBa: A Robustly Optimized Natural Gradient Boosting Training Approach with Leaf Number Clipping

Liliang Ren, Gen Sun|arXiv (Cornell University)|Dec 5, 2019
Machine Learning and Data Classification参考文献 9被引用 5
一句话总结

RoNGBa 提出了一种鲁棒优化的自然梯度提升框架,通过应用叶节点数量剪枝和超参数调优,提升了训练效率和预测性能。通过以叶节点数正则化替代深度约束,并优化了基础学习率、弱学习器数量和最大叶节点数,RoNGBa 在 UCI 基准数据集上实现了最高 4.85 倍的加速,同时保持或提升了准确率,达到当前最优性能。

ABSTRACT

Natural gradient has been recently introduced to the field of boosting to enable the generic probabilistic predication capability. Natural gradient boosting shows promising performance improvements on small datasets due to better training dynamics, but it suffers from slow training speed overhead especially for large datasets. We present a replication study of NGBoost(Duan et al., 2019) training that carefully examines the impacts of key hyper-parameters under the circumstance of best-first decision tree learning. We find that with the regularization of leaf number clipping, the performance of NGBoost can be largely improved via a better choice of hyperparameters. Experiments show that our approach significantly beats the state-of-the-art performance on various kinds of datasets from the UCI Machine Learning Repository while still has up to 4.85x speed up compared with the original approach of NGBoost.

研究动机与目标

  • 为解决 NGBoost 在大规模数据集上训练速度慢的问题,同时保持其强大的预测性能。
  • 通过以叶节点数剪枝作为正则化机制替代最大深度约束,改善泛化能力和训练动态。
  • 识别出在模型复杂度、训练时间和预测准确率之间实现最佳平衡的超参数配置。
  • 证明减少弱学习器数量但增加基学习器复杂度,可在不牺牲预测性能的前提下实现更快训练。
  • 在多样化的 UCI 回归数据集上建立自然梯度提升的新 SOTA 基线。

提出的方法

  • 将基学习器中的最大深度约束替换为最大叶节点数作为正则化技术,以提升模型表达能力和训练效率。
  • 采用最佳优先决策树学习方法,实现叶节点优先生长,相比层级生长可实现更快收敛和更低损失。
  • 通过系统性调优,优化三个关键超参数:基础学习率、弱学习器数量和最大叶节点数。
  • 利用计算权衡洞察:减少弱学习器数量但增加基学习器复杂度,可实现训练时间的线性减少。
  • 在 Energy 数据集上完成初始调优后,对所有数据集采用固定超参数设置(η=0.04, m=500, n=31),以确保一致性和可复现性。
  • 对实验重复 20 次(对较大数据集为 5 次或 1 次),并平均训练时间和指标以实现稳健评估。

实验结果

研究问题

  • RQ1与基于深度的约束相比,叶节点数剪枝是否能提升自然梯度提升的性能和训练速度?
  • RQ2在 NGBoost 中,学习率、弱学习器数量和最大叶节点数的何种超参数配置能实现准确率与训练时间的最佳权衡?
  • RQ3在不牺牲预测性能的前提下,减少弱学习器数量但增加基学习器复杂度是否能实现更快训练?
  • RQ4一个经过优化的超参数设置是否能在多样化的 UCI 回归数据集上实现泛化?
  • RQ5在 RMSE、NLL 和训练时间方面,RoNGBa 与原始 NGBoost 及当前最优方法相比表现如何?

主要发现

  • 在 Protein 数据集上,RoNGBa 相较原始 NGBoost 实现最高 4.85 倍加速,训练时间从 1191.02 秒减少至 502.34 秒。
  • 在 Energy 数据集上,RoNGBa 将 RMSE 从 0.51 降低至 0.35,NLL 从 0.76 降低至 0.37,展现出显著的性能提升。
  • 在 Naval 数据集上,RoNGBa 实现更低的 RMSE(0.00)和更优的 NLL(-5.49),优于 NGBoost 的 -4.88,表明其校准和准确率更优。
  • 在 Year MSD 数据集上,RoNGBa 将训练时间从 14.00 小时减少至 5.15 小时,同时保持几乎相同的 RMSE 和 NLL 值。
  • 在 10 个 UCI 数据集中的 7 个上,RoNGBa 的 RMSE 和 NLL 均优于 NGBoost,且在 Energy、Power 和 Protein 数据集上具有统计显著性提升。
  • 与基于深度的约束相比,使用叶节点数剪枝可使树构建速度提升 30%,原因在于更高效、更深的树生长方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。