Skip to main content
QUICK REVIEW

[論文レビュー] LinXGBoost: Extension of XGBoost to Generalized Local Linear Models

Laurent de Vito|arXiv (Cornell University)|Oct 10, 2017
Gaussian Processes and Bayesian Inference参考文献 11被引用数 5
ひとこと要約

LinXGBoostは、木の葉ノードにおける区分的定数予測を局所線形モデルに置き換えることでXGBoostを拡張し、不連続性や滑らかさの変動がある関数の回帰を改善する。実験では、しばしば5本未塔の非常に少ない木数でXGBoostと同等または優れた性能を達成している。特に低次元設定で顕著である。

ABSTRACT

XGBoost is often presented as the algorithm that wins every ML competition. Surprisingly, this is true even though predictions are piecewise constant. This might be justified in high dimensional input spaces, but when the number of features is low, a piecewise linear model is likely to perform better. XGBoost was extended into LinXGBoost that stores at each leaf a linear model. This extension, equivalent to piecewise regularized least-squares, is particularly attractive for regression of functions that exhibits jumps or discontinuities. Those functions are notoriously hard to regress. Our extension is compared to the vanilla XGBoost and Random Forest in experiments on both synthetic and real-world data sets.

研究の動機と目的

  • XGBoostの区分的定数予測の限界を、区分的線形モデルがより適切な低次元入力空間で解消すること。
  • 標準XGBoostで扱いにくいジャンプや不連続性を示す関数の回帰性能を向上させること。
  • 固定帯域幅またはグローバルモデルではなく、局所線形近似を用いることで、入力依存の滑らかさのモデリングを改善すること。
  • LinXGBoostがXGBoostと比較して、同程度またはより高い予測精度を達成するために必要な木の数を減らせることを示すこと。
  • 研究および実用的応用のための、軽量で解釈可能な実装を提供すること。

提案手法

  • XGBoostの葉ノードにおける定数値を、各葉ノードで線形回帰係数(つまり線形モデル)に置き換える。
  • 各領域(葉)が局所線形モデルにフィットするように、正則化付き最小二乗法として目的関数を定式化する。
  • 各葉ノードにおける局所線形モデルの勾配とヘッセ行列を計算することで、勾配ブースティングを最適化する。
  • 線形モデル係数および葉の数にL2正則化を適用し、過学習を防ぐ。
  • 正則化された目的関数の減少に基づいて、貪欲に木を成長させ、分割は損失関数の最小化によって決定する。
  • Chen (2014) を基に、XGBoostへのプラグインではなく、Pythonで完全から実装することで明確さと拡張性を確保する。

実験結果

リサーチクエスチョン

  • RQ1XGBoostの葉ノードにおける定数予測を局所線形モデルに置き換えることで、不連続性や滑らかさの変動がある関数の回帰性能が向上するか?
  • RQ2LinXGBoostが同程度の予測精度を達成するために必要な木の数は、XGBoostと比較してどの程度か?
  • RQ3合成および実世界のデータセットにおいて、LinXGBoostはXGBoostおよびランダムフォレストを上回る性能を示すか?
  • RQ4どのような設定(例:1次元 vs. 高次元)で局所線形拡張が最も効果を発揮するか?
  • RQ5滑らかさが入力空間全体で変化する関数(例:地形表面や急激な変化を示す信号)を、LinXGBoostは効果的にモデリングできるか?

主な発見

  • LinXGBoostは、合成および実世界のデータセットにおいて、顕著に少ない木数(しばしば5本未塔)でXGBoostと同等または優れたNMSE性能を達成している。
  • CCPPデータセットでは、LinXGBoostのNMSEは0.03567 ± 0.00289と、XGBoostの0.03371 ± 0.00233よりわずかに悪いが、ランダムフォレストと比較して依然として競争力がある。
  • pumadyn-8nmデータセットでは、LinXGBoost(0.03876 ± 0.00177)はXGBoost(0.03737 ± 0.00145)よりわずかに劣るが、ランダムフォレストより優れている。
  • HeavySine関数のような1次元問題では、1本の木でLinXGBoostがXGBoostの区分的定数予測と比較して、視覚的および定量的に優れた結果を示している。
  • ジャンプや不連続性を明示的にモデル化する必要なしに、この種の関数の不連続性を効果的に捉え、このような状況で標準XGBoostを上回る性能を発揮している。
  • 計算コストは高いが、LinXGBoostは滑らかさの変動する非定常関数を原理的かつ効果的にモデリングする手段を提供し、特に低次元回帰タスクにおいて顕著な利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。