[論文レビュー] GBDT-MO: Gradient Boosted Decision Trees for Multiple Outputs
本稿では、各リーフで全出力に対して共通の目的関数の増益を最適化することで、出力変数間の相関を統合的にモデル化する、複数出力向けの新規勾配ブースティング決定木フレームワークGBDT-MOを提案する。2次勾配近似とヒストグラムベースの分割を多出力設定に拡張することで、特に高次元出力において優れた汎化性能と高速な学習を達成するとともに、L₀正則化を用いたスパース出力選択が可能となる。
Gradient boosted decision trees (GBDTs) are widely used in machine learning, and the output of current GBDT implementations is a single variable. When there are multiple outputs, GBDT constructs multiple trees corresponding to the output variables. The correlations between variables are ignored by such a strategy causing redundancy of the learned tree structures. In this paper, we propose a general method to learn GBDT for multiple outputs, called GBDT-MO. Each leaf of GBDT-MO constructs predictions of all variables or a subset of automatically selected variables. This is achieved by considering the summation of objective gains over all output variables. Moreover, we extend histogram approximation into multiple output case to speed up the training process. Various experiments on synthetic and real-world datasets verify that GBDT-MO achieves outstanding performance in terms of both accuracy and training speed. Our codes are available on-line.
研究の動機と目的
- 標準GBDTが出力変数間の相関を無視するという限界を是正すること。
- 1つの木の中で出力依存性を統合的にモデル化することで、多出力学習における構造的冗長性を低減すること。
- 2次勾配近似とヒストグラムベース最適化を用いて、多出力GBDTのスケーラブルで効率的な学習手法を開発すること。
- L₀制約を組み込んだスパーススプリット探索により、各リーフで関連する出力サブセットの自動選択を可能にすること。
- 標準GBDTおよび既存の多出力手法と比較して、汎化性能と学習速度の両方を向上させること。
提案手法
- GBDT-MOは、木の分割時に全出力変数における目的関数増益の合計を最大化する共同目的関数を定式化する。
- 損失関数の2次テイラー近似を多出力ケースに拡張し、より正確で安定した更新を可能にする。
- ヒストグラム近似を複数出力へ一般化し、特徴量の値をビンに分類することで勾配計算を効率化し、高速な学習を実現する。
- 2種類のスパーススプリット探索アルゴリズムを提案:1つは制約なし、もう1つは制約ありで、両者ともL₀正則化を組み込んで各スプリットでの関連出力サブセットの選択を可能にする。
- 制約付きスパースアルゴリズムは、左・右の子ノード間の共有サポートを制限することで、学習速度を向上させる。
- 対角ヘッセ行列近似を用いることで、計算コストを低減しつつ高い精度を維持する。

実験結果
リサーチクエスチョン
- RQ1GBDTにおける複数出力の共同最適化は、出力間相関を捉えることで汎化性能の向上を図れるか?
- RQ2提案された多出力GBDTフレームワークは、標準GBDTおよび既存の多出力手法と比較して、精度と学習速度の面でどのように差がつくか?
- RQ3L₀正則化は、多出力GBDTにおける出力サブセット選択とモデル性能にどのような影響を与えるか?
- RQ4ヒストグラム近似の多出力への拡張は、学習速度の向上にどの程度効果的か?
- RQ5制約付きスパーススプリット探索アルゴリズムは、非制約型と比較して、性能と速度のトレードオフにおいてより優れた性能を示すか?
主な発見
- GBDT-MOは、GBDT-SOやXGBoostと比較して優れた汎化性能を示し、高い訓練損失にもかかわらず、低いテスト損失と高い精度を達成した。
- MNISTおよびCaltech101において、GBDT-MOはGBDT-SOよりもテスト精度で最大1.2%高い性能を示したほか、後続の学習ラウンドでより速い収束を示した。
- GBDT-MOは、特に出力数が多い場合にGBDT-SOやXGBoostと比較して顕著に高速であり、LightGBMと比べてもわずかに高速であった。
- 制約付きスパーススプリット探索アルゴリズムは、非制約型と比較してわずかに高いテスト性能とはるかに高速な学習速度を達成しており、特にスパarsityレベルが高い場合に顕著であった。
- 対角ヘッセ行列近似により、MNISTでは学習時間を約75%、Yeastでは約88%短縮したが、精度低下は最小限(両データセットとも≤0.5%)に抑えられた。
- 最適なスパarsity係数kを用いることで、スパースGBDT-MOは非スパースベースラインを上回り、例としてCaltech101ではk=64で64.1%の精度を達成した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。