Skip to main content
QUICK REVIEW

[论文解读] GBDT-MO: Gradient Boosted Decision Trees for Multiple Outputs

Zhendong Zhang, Jung, Cheolkon|arXiv (Cornell University)|Sep 10, 2019
Machine Learning and Data Classification参考文献 25被引用 11
一句话总结

该论文提出 GBDT-MO,一种用于多输出的新型梯度提升决策树框架,通过在每个叶节点上联合优化所有输出的共享目标增益,联合建模输出变量之间的相关性。通过将二阶梯度近似和基于直方图的分裂方法扩展至多输出设置,GBDT-MO 实现了更优的泛化性能和更快的训练速度——尤其在高维输出场景下表现突出——同时通过 L₀ 正则化实现稀疏输出选择。

ABSTRACT

Gradient boosted decision trees (GBDTs) are widely used in machine learning, and the output of current GBDT implementations is a single variable. When there are multiple outputs, GBDT constructs multiple trees corresponding to the output variables. The correlations between variables are ignored by such a strategy causing redundancy of the learned tree structures. In this paper, we propose a general method to learn GBDT for multiple outputs, called GBDT-MO. Each leaf of GBDT-MO constructs predictions of all variables or a subset of automatically selected variables. This is achieved by considering the summation of objective gains over all output variables. Moreover, we extend histogram approximation into multiple output case to speed up the training process. Various experiments on synthetic and real-world datasets verify that GBDT-MO achieves outstanding performance in terms of both accuracy and training speed. Our codes are available on-line.

研究动机与目标

  • 解决标准 GBDT 在处理多输出时忽略输出变量之间相关性的局限性。
  • 通过在单棵树内联合建模输出依赖关系,减少多输出学习中的结构冗余。
  • 通过二阶梯度近似和基于直方图的优化,开发一种可扩展且高效的多输出 GBDT 训练方法。
  • 通过引入 L₀ 约束的稀疏分裂查找,实现在每个叶节点自动选择相关输出子集。
  • 与标准 GBDT 及现有多输出方法相比,提升泛化性能和训练速度。

提出的方法

  • GBDT-MO 构建联合目标函数,在树分裂过程中最大化所有输出变量的目标增益之和。
  • 将损失函数的二阶泰勒近似扩展至多输出情形,实现更精确和稳定的参数更新。
  • 将直方图近似推广至多输出场景,通过特征值分箱实现高效的梯度计算和快速训练。
  • 提出两种稀疏分裂查找算法:一种无约束,一种有约束,均引入 L₀ 正则化,以在每次分裂时选择相关输出子集。
  • 受限稀疏算法通过约束左右子节点间的共享支持,提升训练速度。
  • 采用对角 Hessian 近似,在保持高精度的同时降低计算成本。
(a) Round 1, variable 1
(a) Round 1, variable 1

实验结果

研究问题

  • RQ1在 GBDT 中对多个输出进行联合优化,能否通过捕捉输出间相关性来提升泛化性能?
  • RQ2所提出的多输出 GBDT 框架在准确率和训练速度上,相较于标准 GBDT 和现有方法表现如何?
  • RQ3L₀ 正则化对多输出 GBDT 中输出子集选择及模型性能有何影响?
  • RQ4将直方图近似扩展至多输出设置,在加速训练方面效果如何?
  • RQ5受限稀疏分裂查找算法是否在性能与速度之间提供了优于无约束变体的更好权衡?

主要发现

  • GBDT-MO 在泛化性能上优于 GBDT-SO 和 XGBoost,尽管训练损失更高,但测试损失更低、准确率更高。
  • 在 MNIST 和 Caltech101 数据集上,GBDT-MO 的测试准确率比 GBDT-SO 最高提升 1.2%,且在后期训练轮次中收敛更快。
  • GBDT-MO 显著快于 GBDT-SO 和 XGBoost,尤其在输出数量较大时优势明显,且略快于 LightGBM。
  • 受限稀疏分裂查找算法在高稀疏度下,测试性能略优且训练速度远超无约束版本。
  • 对角 Hessian 近似在 MNIST 上将训练时间减少约 75%,在 Yeast 上减少约 88%,且准确率下降极小(两数据集均 ≤0.5%)。
  • 在最优稀疏度因子 k 下,稀疏 GBDT-MO 变体可超越非稀疏基线模型,例如在 Caltech101 上达到 64.1% 的准确率(k=64)。
(b) Round 1, variable 2
(b) Round 1, variable 2

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。