Skip to main content
QUICK REVIEW

[論文レビュー] RoNGBa: A Robustly Optimized Natural Gradient Boosting Training Approach with Leaf Number Clipping

Liliang Ren, Gen Sun|arXiv (Cornell University)|Dec 5, 2019
Machine Learning and Data Classification参考文献 9被引用数 5
ひとこと要約

RoNGBa は、リーフ数のクリッピングとハイパーパramータチューニングを適用することで、学習効率と予測性能を向上させる、ロバストに最適化された自然勾配ブースティングフレームワークを提案する。深さ制約をリーフ数正則化に置き換え、学習率、アンサンブル数、最大リーフ数を最適化することで、RoNGBa は最大 4.85 倍の高速化を達成し、UCIベンチマークデータセットで最先端の性能を発揮する一方で、精度を維持または向上させる。

ABSTRACT

Natural gradient has been recently introduced to the field of boosting to enable the generic probabilistic predication capability. Natural gradient boosting shows promising performance improvements on small datasets due to better training dynamics, but it suffers from slow training speed overhead especially for large datasets. We present a replication study of NGBoost(Duan et al., 2019) training that carefully examines the impacts of key hyper-parameters under the circumstance of best-first decision tree learning. We find that with the regularization of leaf number clipping, the performance of NGBoost can be largely improved via a better choice of hyperparameters. Experiments show that our approach significantly beats the state-of-the-art performance on various kinds of datasets from the UCI Machine Learning Repository while still has up to 4.85x speed up compared with the original approach of NGBoost.

研究の動機と目的

  • 大規模データセットにおける NGBoost の遅い学習速度を解決しつつ、その優れた予測性能を維持すること。
  • 最大深さ制約をリーフ数クリッピングという正則化手法に置き換えることで、一般化性能と学習ダイナミクスを向上させること。
  • モデルの複雑さ、学習時間、予測精度のバランスをとる最適なハイパーパramータ設定を特定すること。
  • 弱学習器の数を減らし、ベースラーナーの複雑さを増やすことで、性能を維持または向上させつつ、学習を高速化できるかを検証すること。
  • 多様な UCI レンジスティックデータセットにおける自然勾配ブースティングの新しい SOTA ベースラインを確立すること。

提案手法

  • ベースラーナーにおける最大深さ制約を、モデル表現力と学習効率の向上を目的とした最大リーフ数に置き換える正則化技術として採用する。
  • 最良優先の決定木学習を用いて、リーフ単位で木を成長させることで、レベルワイズな成長に比べて収束が速く、損失が低い。
  • 学習率、アンサンブル数、最大リーフ数という3つの主要なハイパーパramータを体系的なチューニングにより最適化する。
  • 計算的トレードオフの洞察を応用する:アンサンブル数を減らし、ベースラーナーの複雑さを増やすことで、学習時間が線形に短縮される。
  • 一貫性と再現性を確保するため、最初に Energy データセットでチューニングを行い、その後すべてのデータセットに同一のハイパーパramータ設定(η=0.04, m=500, n=31)を適用する。
  • 20回(大きなデータセットでは5回または1回)の実験を繰り返し、学習時間と指標の平均値を算出することで、堅牢な評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1深さ制約と比較して、リーフ数クリッピングは自然勾配ブースティングの性能と学習速度を向上させることができるか?
  • RQ2学習率、アンサンブル数、最大リーフ数というハイパーパラメータの組み合わせで、精度と学習時間の最良なトレードオフを達成できるか?
  • RQ3アンサンブル数を減らし、ベースラーナーの複雑さを増やすことで、予測性能を損なわず、学習を高速化できるか?
  • RQ4最適化されたハイパーパラメータ設定は、多様な UCI レンジスティックデータセットに一般化可能か?
  • RQ5RMSE、NLL、学習時間の観点から、RoNGBa は元の NGBoost や最先端手法と比較してどのように優れているか?

主な発見

  • Protein データセットにおいて、RoNGBa は元の NGBoost と比較して最大 4.85 倍の高速化を達成し、学習時間を 1191.02 秒から 502.34 秒に短縮した。
  • Energy データセットでは、RMSE を 0.51 から 0.35、NLL を 0.76 から 0.37 に低下させ、顕著な性能向上を示した。
  • Naval データセットでは、NGBoost が記録した -4.88 に対し、RoNGBa は RMSE 0.00 と低い値を達成し、NLL を -5.49 まで改善し、より良いキャリブレーションと精度を示した。
  • Year MSD データセットでは、学習時間を 14.00 時間から 5.15 時間に短縮したが、RMSE と NLL の値はほぼ同一を維持した。
  • RMSE と NLL の観点から、10 個の UCI データセットのうち 7 個で NGBoost を上回り、Energy、Power、Protein データセットでは統計的に有意な改善を示した。
  • 深さ制約ではなくリーフ数クリッピングを採用することで、より効率的で深い木の成長が可能になり、木の構築が 30% 速くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。