Skip to main content
QUICK REVIEW

[论文解读] MT-GBM: A Multi-Task Gradient Boosting Machine with Shared Decision Trees

ZhenZhe Ying, Zhuoer Xu|arXiv (Cornell University)|Jan 17, 2022
Advanced Neural Network Applications被引用 4
一句话总结

MT-GBM 是一种新型的多任务梯度提升机,通过联合优化多任务损失函数,在多个任务间学习共享的决策树结构,从而在表格型数据中实现高效且有效的多任务学习。与单任务 GBDT 模型相比,MT-GBM 在主任务上的 RMSE 最高提升 23%,MAPE 提升 9%,在欺诈检测任务中通过共享表征实现显著性能增益。

ABSTRACT

Despite the success of deep learning in computer vision and natural language processing, Gradient Boosted Decision Tree (GBDT) is yet one of the most powerful tools for applications with tabular data such as e-commerce and FinTech. However, applying GBDT to multi-task learning is still a challenge. Unlike deep models that can jointly learn a shared latent representation across multiple tasks, GBDT can hardly learn a shared tree structure. In this paper, we propose Multi-task Gradient Boosting Machine (MT-GBM), a GBDT-based method for multi-task learning. The MT-GBM can find the shared tree structures and split branches according to multi-task losses. First, it assigns multiple outputs to each leaf node. Next, it computes the gradient corresponding to each output (task). Then, we also propose an algorithm to combine the gradients of all tasks and update the tree. Finally, we apply MT-GBM to LightGBM. Experiments show that our MT-GBM improves the performance of the main task significantly, which means the proposed MT-GBM is efficient and effective.

研究动机与目标

  • 为解决将梯度提升决策树(GBDT)应用于多任务学习的挑战,其中共享表征至关重要但难以学习。
  • 使 GBDT 模型能够通过在任务间共享树结构,联合优化多个损失函数,从而提升泛化能力和效率。
  • 通过基于残差误差尺度自适应调整各任务的学习率,稳定不同残差误差尺度任务的训练过程。
  • 开发一种可无缝集成到现有 GBDT 框架(如 LightGBM)中的方法,且计算开销极低。
  • 证明在真实世界表格型数据应用中,共享树结构可显著提升主任务和辅助任务的性能。

提出的方法

  • 为每个叶节点分配多个输出,使每棵树能够同时对多个任务进行预测。
  • 在提升过程中,为每个输出(任务)计算任务特定的梯度。
  • 使用考虑残差误差尺度的加权聚合策略,将所有任务的梯度组合起来,以稳定训练过程。
  • 使用组合梯度更新树结构和叶节点值,同时保持任务间共享的分裂方式。
  • 通过修改 LightGBM 的训练循环,将该方法集成到 LightGBM 中,支持使用共享树的多任务学习。
  • 基于残差误差的大小,对每个任务自适应调整学习率,以平衡各任务的收敛速度。

实验结果

研究问题

  • RQ1在表格型数据的多任务学习中,能否有效学习共享的决策树结构?
  • RQ2在 GBDT 中,如何组合多任务梯度以在任务残差误差尺度不同时稳定训练?
  • RQ3与单任务 GBDT 模型相比,学习任务间的共享表征是否能提升主任务的性能?
  • RQ4MT-GBM 是否能高效地集成到现有 GBDT 框架(如 LightGBM)中,且计算开销可忽略?
  • RQ5在 MT-GBM 中,引入低相关性或高相关性的辅助任务,对主任务性能有何影响?

主要发现

  • 在第一个金融数据集上,MT-GBM 将主任务的 RMSE 从 400.32 降低至 308.21,MAPE 从 4.3% 降低至 3.9%,RMSE 提升 23%,MAPE 提升 9%。
  • 在欺诈检测数据集上,包含四个辅助任务的 MT-GBM 平均 ROC-AUC 达到 0.9454,优于 LightGBM(0.9369)和 XGBoost(0.9443)。
  • 四任务 MT-GBM 模型达到最高性能,表明结合多个相关子任务可增强模型鲁棒性和预测能力。
  • 即使在低相关性任务(如任务 2 的相关系数为 0.309)下,MT-GBM 仍保持强劲性能,表明知识迁移有效。
  • 神经网络在相同数据集上表现较差,凸显 MT-GBM 在具有异质特征和噪声输入的表格型数据中的优越性。
  • 该方法展现出稳定的收敛性和改进的泛化能力,尤其在基于残差误差尺度自适应调整学习率时更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。