Skip to main content
QUICK REVIEW

[論文レビュー] Minimal Variance Sampling in Stochastic Gradient Boosting

Bulat Ibragimov, Gleb Gusev|arXiv (Cornell University)|Oct 29, 2019
Machine Learning and Data Classification被引用数 12
ひとこと要約

本稿では、勾配勾配ブースティングにおけるスコアの分散を最小化するようにサンプリング確率を最適化する、新しい重み付きサンプリング手法である最小分散サンプリング(MVS)を提案する。これにより、より少ない学習例で高いモデル精度が達成できる。MVSは勾配の大きさに基づいてサンプルを適応的に重み付けすることで、SGB や GOSS と比較して、必要なサンプル数を最大50%まで削減しながら、精度を向上または維持する。MVS は、SGB と同等の性能を達成するが、より少ないサンプル数で高い精度を発揮する。

ABSTRACT

Stochastic Gradient Boosting (SGB) is a widely used approach to regularization of boosting models based on decision trees. It was shown that, in many cases, random sampling at each iteration can lead to better generalization performance of the model and can also decrease the learning time. Different sampling approaches were proposed, where probabilities are not uniform, and it is not currently clear which approach is the most effective. In this paper, we formulate the problem of randomization in SGB in terms of optimization of sampling probabilities to maximize the estimation accuracy of split scoring used to train decision trees. This optimization problem has a closed-form nearly optimal solution, and it leads to a new sampling technique, which we call Minimal Variance Sampling (MVS). The method both decreases the number of examples needed for each iteration of boosting and increases the quality of the model significantly as compared to the state-of-the art sampling methods. The superiority of the algorithm was confirmed by introducing MVS as a new default option for subsampling in CatBoost, a gradient boosting library achieving state-of-the-art quality on various machine learning tasks.

研究の動機と目的

  • Stochastic Gradient Boosting (SGB) のデータサンプリングにおいて、理論的最適化が欠如している問題に対処すること。既存手法は任意またはヒューリスティックなサンプリング確率を用いている。
  • SGB におけるサンプリング問題を、木の構築中にスプリットスコアリングの精度を最大化する最適化問題として定式化すること。
  • 勾配推定値の分散を最小化する閉形式でほぼ最適なサンプリング確率の解を導出すること。
  • 実用的で適応的なサンプリング手法、すなわち最小分散サンプリング(MVS)を考案し、均一サンプリングおよび最先端のサンプリング手法を上回る精度と効率性を実現すること。
  • CatBoost におけるデフォルトのサブサンプリング戦略として統合するため、多様なデータセットを用いたMVSの実証的検証を実施すること。

提案手法

  • スプリットスコアリングに使用される勾配推定値の分散を最小化する問題として、制約付き最適化問題としてサンプリング問題を定式化すること。
  • 勾配導関数(損失勾配)の絶対値に依存する閉形式のサンプリング確率の解を導出すること。勾配が大きいサンプルほど高いサンプリング確率が与えられる。
  • サンプリング効率と分散低減のトレードオフを制御するためのハイパーパrameter λ を導入し、適応的サンプリングを可能にする。
  • データ分布に基づいて λ を動的に調整することで、手動による λ のチューニングが不要となる、MVS Adaptive という変種を提案する。
  • CatBoost および LightGBM に MVS を実装し、SGB および GOSS と同一の学習条件下で直接比較可能にする。
  • 複数のベンチマークデータセットを用いた実証的評価により、各手法のモデル精度、学習時間、および必要なサンプル数を比較する。

実験結果

リサーチクエスチョン

  • RQ1勾配ブースティング木の構築中にスプリットスコアリングの分散を最小化するための最適なサンプリング分布は何か?
  • RQ2理論的根拠に基づいた閉形式のサンプリング戦略は、ヒューリスティックまたは均一サンプリングを上回る精度と学習効率を達成できるか?
  • RQ3MVS は、サンプル数を減らした場合に SGB や GOSS と比較して、モデル精度でどのように差をつけるか?
  • RQ4MVS は、モデル性能を維持または向上させながら、学習時間をどの程度短縮できるか?
  • RQ5MVS の適応的バージョンは、ハイパーパrameter のチューニングを不要とし、最適な性能を維持できるか?

主な発見

  • MVS は、SGB と比較して、1イテレーションあたりの必要なサンプル数を最大50%まで削減しながら、モデル精度を維持または向上させる。
  • サンプルレートが 0.5 の場合、平均的にベースラインと比較して相対誤差を -0.45%まで低減し、SGB や GOSS を上回る性能を示した。
  • Higgs データセットでは、MVS は 80%のサンプルレートでベースラインの性能に達するが、SGB は 100%未満では失敗する。これは、MVS がはるかに優れたサンプル効率を示していることを示している。
  • Recsys データセットでは、MVS は 10%のサンプルレートで学習時間を 61.5%まで短縮し、SGB や GOSS を著しく上回った。
  • MVS Adaptive はハイパーパrameter のチューニングが不要でありながら、ほぼ最適な性能を達成し、チューニングの負荷を低減しながら高い精度を維持した。
  • MVS は現在、CatBoost のデフォルトのサブサンプリング手法となっており、LightGBM にも統合され、実用的優位性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。