[论文解读] Minimal Variance Sampling in Stochastic Gradient Boosting
本文提出了一种名为最小方差采样(MVS)的新颖加权采样技术,用于随机梯度提升(Stochastic Gradient Boosting, SGB),通过优化采样概率以最小化分裂评分中的方差,从而在更少的训练样本下实现更高的模型准确率。MVS通过基于梯度幅值自适应加权样本,将所需样本量最多减少50%,同时在准确率上优于或等同于SGB和GOSS,达到当前最优性能。
Stochastic Gradient Boosting (SGB) is a widely used approach to regularization of boosting models based on decision trees. It was shown that, in many cases, random sampling at each iteration can lead to better generalization performance of the model and can also decrease the learning time. Different sampling approaches were proposed, where probabilities are not uniform, and it is not currently clear which approach is the most effective. In this paper, we formulate the problem of randomization in SGB in terms of optimization of sampling probabilities to maximize the estimation accuracy of split scoring used to train decision trees. This optimization problem has a closed-form nearly optimal solution, and it leads to a new sampling technique, which we call Minimal Variance Sampling (MVS). The method both decreases the number of examples needed for each iteration of boosting and increases the quality of the model significantly as compared to the state-of-the art sampling methods. The superiority of the algorithm was confirmed by introducing MVS as a new default option for subsampling in CatBoost, a gradient boosting library achieving state-of-the-art quality on various machine learning tasks.
研究动机与目标
- 为解决随机梯度提升(SGB)中数据采样缺乏理论优化的问题,现有方法使用任意或启发式采样概率。
- 将SGB中的采样问题形式化为一个优化任务,以在树构建过程中最大化分裂评分的准确性。
- 推导出一个闭式解,近似最优的采样概率,以最小化梯度估计的方差。
- 开发一种实用的自适应采样方法——最小方差采样(MVS),其在准确率和效率方面优于均匀采样和当前最优的采样技术。
- 在多种数据集上通过实证验证MVS,并将其作为CatBoost中的默认子采样策略集成。
提出的方法
- 将采样问题形式化为最小化用于分裂评分的梯度估计方差,将其视为一个带约束的优化问题。
- 推导出依赖于梯度导数(损失梯度)绝对值的采样概率闭式解,使梯度较大的样本获得更高的采样概率。
- 引入一个超参数λ以控制采样效率与方差减少之间的权衡,实现自适应采样。
- 提出MVS Adaptive,一种可动态根据数据分布调整λ的变体,从而消除手动调参的需要。
- 在CatBoost和LightGBM中实现MVS,使在相同训练条件下与SGB和GOSS进行直接比较成为可能。
- 在多个基准数据集上进行实证评估,比较不同方法在模型准确率、学习时间及所需样本量方面的表现。
实验结果
研究问题
- RQ1在梯度提升树构建过程中,为最小化分裂评分方差,最优的采样分布是什么?
- RQ2是否一种理论基础坚实、具有闭式解的采样策略,能在准确率和训练效率上均优于启发式或均匀采样?
- RQ3在使用更少样本量的情况下,MVS与SGB和GOSS在模型准确率方面有何比较?
- RQ4MVS在保持或提升模型性能的同时,能在多大程度上减少训练时间?
- RQ5MVS的自适应版本是否能消除超参数调优的需要,同时保持最优性能?
主要发现
- 与SGB相比,MVS将每次迭代所需的样本量最多减少50%,同时保持或提升模型准确率。
- 在样本率为0.5时,MVS平均相对误差减少-0.45%,优于基线模型,表现优于SGB和GOSS。
- 在Higgs数据集上,MVS在80%样本率下即可达到基线性能,而SGB在低于100%时无法达到,显示出更高的样本效率。
- 在Recsys数据集上,MVS在10%样本率下将训练时间减少61.5%,显著优于SGB和GOSS。
- MVS Adaptive变体在无需超参数调优的情况下实现接近最优的性能,减少了调优开销,同时保持高准确率。
- MVS现已成为CatBoost的默认子采样方法,并已集成至LightGBM,证实了其实际优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。