Skip to main content
QUICK REVIEW

[論文レビュー] MT-GBM: A Multi-Task Gradient Boosting Machine with Shared Decision Trees

ZhenZhe Ying, Zhuoer Xu|arXiv (Cornell University)|Jan 17, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

MT-GBM は、複数のタスク間で共有される意思決定木構造を、マルチタスク損失を共同で最適化することで学習する、新しいマルチタスク勾配ブースティングマシンである。この手法により、表形式データにおけるマルチタスク学習が効率的かつ効果的に実現され、メインタスクの性能が単一タスクのGBDTモデルと比較して、RMSEで最大23%、MAPEで9%向上した。特に、共有表現を用いることで、不正検出タスクにおいて顕著な向上が得られた。

ABSTRACT

Despite the success of deep learning in computer vision and natural language processing, Gradient Boosted Decision Tree (GBDT) is yet one of the most powerful tools for applications with tabular data such as e-commerce and FinTech. However, applying GBDT to multi-task learning is still a challenge. Unlike deep models that can jointly learn a shared latent representation across multiple tasks, GBDT can hardly learn a shared tree structure. In this paper, we propose Multi-task Gradient Boosting Machine (MT-GBM), a GBDT-based method for multi-task learning. The MT-GBM can find the shared tree structures and split branches according to multi-task losses. First, it assigns multiple outputs to each leaf node. Next, it computes the gradient corresponding to each output (task). Then, we also propose an algorithm to combine the gradients of all tasks and update the tree. Finally, we apply MT-GBM to LightGBM. Experiments show that our MT-GBM improves the performance of the main task significantly, which means the proposed MT-GBM is efficient and effective.

研究の動機と目的

  • 勾配ブースティング意思決定木(GBDT)をマルチタスク学習に適用する課題に対処すること。ここでは、共有表現が不可欠であるが、学習が困難である。
  • タスク間で木構造を共有することで、GBDTモデルが複数の損失関数を共同で最適化できるようにし、汎化性能と効率性を向上させること。
  • 残差誤差のスケールが異なるタスク間で、学習率をタスクごとに適応的に調整することで、訓練の安定性を高めること。
  • LightGBM などの既存のGBDTフレームワークに、最小限の計算オーバーヘッドでシームレスに統合できる手法を開発すること。
  • 共有木構造が、実世界の表形式データ応用におけるメインタスクおよび補助タスクの性能を顕著に向上させることを実証すること。

提案手法

  • 各リーフノードに複数の出力を割り当て、各木が同時に複数のタスクを予測できるようにする。
  • ブースティングプロセス中に、各出力(タスク)ごとにタスク固有の勾配を計算する。
  • 残差誤差のスケールを考慮した重み付き集約戦略を用いて、全タスクの勾配を統合し、訓練の安定性を高める。
  • 統合勾配を用いて木構造とリーフ値を更新し、タスク間で共有されるスプリットを維持する。
  • LightGBM のトレーニングループを変更することで、共有木を用いたマルチタスク学習をサポートする形で、手法を統合する。
  • 残差誤差の大きさに応じて、タスクごとの学習率を適応的に調整することで、タスク間の収束バランスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1表形式データにおけるマルチタスク学習の勾配ブースティングにおいて、共有意思決定木構造を効果的に学習できるか?
  • RQ2タスク間の残差誤差スケールが異なる場合、GBDTにおけるマルチタスク勾配をどのように統合すれば訓練が安定化するか?
  • RQ3タスク間で共有表現を学習することで、単一タスクGBDTモデルと比較してメインタスクの性能が向上するか?
  • RQ4LightGBM などの既存GBDTフレームワークに、顕著な計算オーバーヘッドを伴わずに効率的に実装できるか?
  • RQ5低相関または高相関の補助タスクを含めると、MT-GBMにおけるメインタスクの性能にどのような影響を与えるか?

主な発見

  • 最初の金融データセットにおいて、MT-GBMはメインタスクのRMSEを400.32から308.21に低下させ、MAPEを4.3%から3.9%に改善し、RMSEで23%、MAPEで9%の向上を達成した。
  • 不正検出データセットでは、4つの補助タスクを用いたMT-GBMが、平均ROC-AUC 0.9454(3倍)を達成し、LightGBM(0.9369)とXGBoost(0.9443)を上回った。
  • 4タスクのMT-GBMモデルが最高の性能を示し、関連する複数のサブタスクを組み合わせることで、より頑健で予測力の高いモデルが得られることを示した。
  • 低相関タスク(例:相関係数0.309のタスク2)でさえも、MT-GBMは強力な性能を維持しており、有効な知識移転が実現していることを示唆した。
  • ニューラルネットワークは、同じデータセットで劣った性能を示した。これは、MT-GBMが特徴が不均一でノイズが多い表形式データに対して優れた性能を発揮することを示している。
  • 適応的学習率(残差誤差スケールに基づく)を用いることで、収束が安定し、特に汎化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。