Skip to main content
QUICK REVIEW

[论文解读] Multi-Layered Gradient Boosting Decision Trees

Ji Feng, Yu Yang|arXiv (Cornell University)|May 31, 2018
Neural Networks and Applications被引用 63
一句话总结

本文提出多层 GBDT 森林(mGBDT),通过堆叠回归 GBDT 并以类似目标传播的过程进行训练而非反向传播,学习层次表示。在表格数据上展示表示学习能力并实现具有竞争力的性能。

ABSTRACT

Multi-layered representation is believed to be the key ingredient of deep neural networks especially in cognitive tasks like computer vision. While non-differentiable models such as gradient boosting decision trees (GBDTs) are the dominant methods for modeling discrete or tabular data, they are hard to incorporate with such representation learning ability. In this work, we propose the multi-layered GBDT forest (mGBDTs), with an explicit emphasis on exploring the ability to learn hierarchical representations by stacking several layers of regression GBDTs as its building block. The model can be jointly trained by a variant of target propagation across layers, without the need to derive back-propagation nor differentiability. Experiments and visualizations confirmed the effectiveness of the model in terms of performance and representation learning ability.

研究动机与目标

  • 在非可微分模型(如 GBDT)用于表格数据时,阐明对深层表示的需求。
  • 提出一个多层 GBDT 架构以学习层次化的表示。
  • 开发一种不使用反向传播的训练过程,通过伪标签联合优化所有层。
  • 在真实数据集上展示表示学习能力与具有竞争力的性能。
  • 探索非可微深度模型的潜在扩展和应用。

提出的方法

  • 构建一个带有 M-1 个中间层和一个最终输出层的多层前馈结构。
  • 将正向映射 F_i 定义为非可微分的 GBDT 基础层,并引入逆映射 G_i 以形成伪逆对。
  • 使用目标传播的变体:通过逆向映射将顶层目标向下传播来计算每一层的伪标签。
  • 通过对伪标签推导得到的伪残差,使用梯度提升步骤更新每个 F_i;训练 G_i 将前向输出映射回上一层表示。
  • 在逆路径中引入高斯噪声以正则化和稳定学习;以微小的树和微小的高斯输出进行初始化以启动。
  • 提供自底向上的更新计划,其中先更新 F_i,再更新上层,迭代 E 轮。

实验结果

研究问题

  • RQ1多层由非微分组件(GBDT)组成的模型能否在不使用反向传播的情况下端到端训练?
  • RQ2堆叠的 GBDT 层是否能学习出类似深度神经网络的层次化、分布式表示?
  • RQ3在有监督和无监督设定下,与神经网络和单一 GBDT 相比,mGBDT 的表现如何?
  • RQ4增加深度是否会提升表格数据的表示质量以及分类/回归性能?

主要发现

  • 与比较方法相比,mGBDT 在 Income 和 Protein 数据集的实验中取得了最高准确率。
  • 在 Income 数据集中,mGBDT 的准确率为 0.8742,相比之下 XGBoost 0.8719,XGBoost Stacking 0.8697,NN(TargetProp) 0.8491,NN(BackProp) 0.8534,Protein 数据集也呈现类似趋势。
  • 无监督的 mGBDT 自编码器可以产生分布式表示,可视化显示在更高层次的编码具有有意义的特征。
  • 更深层的 mGBDT 堆栈在可视化中产生更好的表示,并提升真实数据任务的性能。
  • 与通过反向传播或目标传播训练的神经网络相比,mGBDT 在所测试的数据集上收敛更快,且达到具有竞争力甚至更优的准确率。
  • 层深度的变化表明 mGBDT 的鲁棒性,目标传播基础的神经网络在深度增加时鲁棒性较差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。