[論文レビュー] Learning to Tune XGBoost with XGBoost
本稿では、メタ学習を組み込んだ逐次半分法(successive halving)の変種であるMeSHを提案する。MeSHは、初期段階の評価から最終的なモデル性能を予測するメタ回帰モデルを用いる。95のデータセットで学習したMeSHは、XGBoostをメタ回帰モデルとして用いることで、5つのテストデータセットのうち3つでランダムサーチおよび標準的な逐次半分法を上回り、同じ総予算内でより低い検証損失を達成した。
In this short paper we investigate whether meta-learning techniques can be used to more effectively tune the hyperparameters of machine learning models using successive halving (SH). We propose a novel variant of the SH algorithm (MeSH), that uses meta-regressors to determine which candidate configurations should be eliminated at each round. We apply MeSH to the problem of tuning the hyperparameters of a gradient-boosted decision tree model. By training and tuning our meta-regressors using existing tuning jobs from 95 datasets, we demonstrate that MeSH can often find a superior solution to both SH and random search.
研究の動機と目的
- 過去のチューニング経験を活用することで、XGBoostのハイパーパrameterチューニングの効率を向上させること。
- 逐次半分法(SH)の限界、すなわち初期段階の順位付けが最終的な性能を予測できないことに対処すること。
- SHの実行中に追加コストなしに入手可能なランドマークメタ特徴量を用いて、メタ回帰モデルを訓練し、より良い設定選択が可能かどうかを検討すること。
- 早期段階の結果とメタ特徴量を用いて最終的な検証損失を予測することで、メタラーニングがSHをどのように向上させるかを評価すること。
- 同じ予算条件下で、MeSHがランダムサーチおよび標準的なSHよりも優れたハイパーパrameter設定を発見できることを実証すること。
提案手法
- MeSHは、検証損失の代わりにメタ回帰モデルの予測値を用いて、各ラウンドでどの設定を除外するかを決定することで、逐次半分法を変更する。
- 各ラウンドで、メタ回帰モデルは、データセットのメタ特徴量、ハイパーパramータ設定、および小さいリソースでの以前の検証損失に基づいて、各設定の最終的検証損失を予測する。
- メタ回帰モデルは、95のOpenMLデータセットからの30万件の例を用いて、事前に学習されたもので、KNN、MLP、XGBoostを候補モデルとして使用する。
- メタデータセットには、リソースを16から1024に段階的に増やしながら、設定の初期評価から抽出されたランドマークメタ特徴量が含まれる。
- オンライン段階では、SHおよびランダムサーチと同一の予算を用いる:64の設定、リソース範囲16~1024、η=2、7ラウンド。
- 各テストデータセットについて、学習から除外された5つのデータセットがあり、メタ回帰モデルのハイパーパramータチューニングには3分割交差検証が用いられた。
実験結果
リサーチクエスチョン
- RQ1初期段階の評価からのメタ学習予測が、逐次半分法における設定選択を改善できるか?
- RQ2過去のチューニングジョブで学習したメタ回帰モデルを用いることで、標準的な逐次半分法よりも優れた最終的なハイパーパrameter設定が得られるか?
- RQ3多様なデータセットにおいて、MeSHは検証損失の観点でランダムサーチおよび標準的な逐次半分法と比べてどのように差をつけるか?
- RQ4MeSHフレームワークにおいて、どのメタ回帰モデルアーキテクチャ(KNN、MLP、XGBoost)が最も優れた性能を示すか?
- RQ5XGBoostのハイパーパラメータチューニングにおいて、初期の性能トレンドと最終的な性能の相関はどの程度強いのか?
主な発見
- XGBoostをメタ回帰モデルとして用いたMeSHは、5つのテストデータセットのうち3つで平均検証損失が最も低く、ランダムサーチおよび逐次半分法を上回った。
- データセット904では、XGBoostを用いたMeSHの検証損失は0.2986にまで低下したのに対し、標準的な逐次半分法は0.3024、ランダムサーチは0.3139であった。
- オフライン段階では、ランドマークメタ特徴量(初期評価)が増えるにつれて、メタ回帰モデルの予測精度が向上した。
- XGBoostをメタ回帰モデルとして用いたMeSHは、データセット930で平均検証損失0.4881を達成し、逐次半分法(0.4907)およびランダムサーチ(0.4903)をわずかに上回った。
- すべての5つのテストデータセットにおいて、XGBoostを用いたMeSHは、逐次半分法を下回ることはなく、3つのケースでは有意に優れていた。
- XGBoostメタ回帰モデルは、すべてのテストデータセットでKNNおよびMLPを一貫して上回り、このメタラーニングタスクに適していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。