Skip to main content
QUICK REVIEW

[論文レビュー] Gradient Boosting With Piece-Wise Linear Regression Trees

Yu Shi, Jian Li|arXiv (Cornell University)|Feb 15, 2018
Machine Learning and Data Classification参考文献 23被引用数 10
ひとこと要約

この論文は、段階的定数木の代わりに線形モデルをリーフに使用することで、収束速度の向上と精度の向上を実現する、区分線形回帰木を用いた勾配ブースティング(GBDT-PL)を提案する。本手法は、逐次的特徴選択、半加法的フィッティング、SIMD最適化実装を用いて、XGBoost、LightGBM、CatBoostと同等のトレーニング速度を達成しながら、密度の高い数値データセットにおいて精度と収束速度の両面で優れている。

ABSTRACT

Gradient Boosted Decision Trees (GBDT) is a very successful ensemble learning algorithm widely used across a variety of applications. Recently, several variants of GBDT training algorithms and implementations have been designed and heavily optimized in some very popular open sourced toolkits including XGBoost, LightGBM and CatBoost. In this paper, we show that both the accuracy and efficiency of GBDT can be further enhanced by using more complex base learners. Specifically, we extend gradient boosting to use piecewise linear regression trees (PL Trees), instead of piecewise constant regression trees, as base learners. We show that PL Trees can accelerate convergence of GBDT and improve the accuracy. We also propose some optimization tricks to substantially reduce the training time of PL Trees, with little sacrifice of accuracy. Moreover, we propose several implementation techniques to speedup our algorithm on modern computer architectures with powerful Single Instruction Multiple Data (SIMD) parallelism. The experimental results show that GBDT with PL Trees can provide very competitive testing accuracy with comparable or less training time.

研究の動機と目的

  • 区分線形回帰木(PL 樹木)をベースラーナーとして用いることで、勾配ブースティング意思決定木(GBDT)の表現能力を向上させること。
  • 区分線形木のトレーニングにおける高い計算コストを低減するための、効率的なアルゴリズム的およびシステムレベルの最適化を設計すること。
  • XGBoost、LightGBM、CatBoostなどの最先端のGBDTツールキットと同等のトレーニング効率を達成するとともに、密度の高い数値データセットにおける予測精度を向上させること。
  • 現代のCPUのSIMD並列処理とキャッシュに配慮したデータ構造を用いて、GBDTにおけるPL 樹木のスケーラブルで高効率なトレーニングを可能にすること。

提案手法

  • GBDTにおける2次近似を拡張し、ベースラーナーとしてPL 樹木を採用することで、より表現力の高いリーフモデルによる収束速度の向上を実現する。
  • 木の成長過程において逐次的特徴選択を導入し、線形モデルのサイズを制限し、フィッティングコストを低減する。
  • 木の構築中に線形モデルを効率的に更新するための半加法的フィッティングを提案し、大規模モデルの再フィッティングを回避する。
  • 区分線形木へのヒストグラム技術の適応を提案し、効率的なスプリット評価を実現する。
  • ビットマニピュレーションとメモリアクセスパターンの最適化を用いてデータレイアウトを最適化し、キャッシュミスを削減するとともにSIMD並列処理を加速する。
  • アルゴリズム的最適化と低レベルのシステムレベルのパフォーマンス工学を統合したカスタムトレーニングパイプラインを実装する。

実験結果

リサーチクエスチョン

  • RQ1区分線形回帰木(PL 樹木)は、標準的な区分定数木と比較して、勾配ブースティングの収束速度と精度を向上させることができるか?
  • RQ2大規模データセット上でPL 樹木のトレーニングをスケーラブルかつ効率的に行うために、どのようなアルゴリズム的およびシステムレベルの最適化が必要か?
  • RQ3XGBoost、LightGBM、CatBoostなどの最先端GBDT実装と比較して、提案されたGBDT-PL手法のトレーニング速度とテスト精度はどの程度か?
  • RQ4逐次的特徴選択と半加法的フィッティングは、PL 樹木における線形モデルのフィッティングコストをどの程度低減するか?
  • RQ5適切なデータ構造設計とメモリアクセス最適化を通じて、PL 樹木のトレーニングにおいてSIMD並列処理を効果的に活用できるか?

主な発見

  • GBDT-PLは、10個の公開済み密度の高い数値データセットにおいて、XGBoost、LightGBM、CatBoostを上回るテスト精度を達成しており、回帰タスクにおいて顕著な優位性を示している。
  • ベースラインGBDT手法と比較して収束が速く、複数のデータセットにおける反復毎の精度曲線から、同じ精度に到達するのに必要な木の数が少ないことが示された。
  • 固定された5つの回帰器を用いた場合、GBDT-PLは競争力のある性能を示し、回帰器の数を増やすことでさらに精度が向上した。
  • トレーニング時間は最先端のツールキットと同等またはそれ以下であり、多数のデータセットにおいて、同等または短い時間でより高い精度を達成した。
  • 逐次的特徴選択と半加法的フィッティングの組み合わせにより、PL 樹木における線形モデルのフィッティングコストが著しく低減されたが、精度に影響を与えることなく実現された。
  • キャッシュに配慮したデータレイアウトとSIMD最適化実装により、トレーニング遅延が顕著に削減され、大規模応用に実用的であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。