Skip to main content
QUICK REVIEW

[論文レビュー] ReinBo: Machine Learning pipeline search and configuration with Bayesian Optimization embedded Reinforcement Learning

Xudong Sun, Jiali Lin|arXiv (Cornell University)|Apr 10, 2019
Machine Learning and Data Classification参考文献 29被引用数 9
ひとこと要約

ReinBoは、階層的・条件付きのハイパーパramータースペース内で機械学習パイプラインの共同探索と設定を可能にする、革新的なAutoMLフレームワークを提案する。問題をパイプライン選択とハイパーパramーターオプティマイゼーションのサブタスクに分解することで、Auto-sklearn、TPOT、およびランダムサーチと比較して、より高速な収束と低いリソース使用量で最先端の性能を達成する。

ABSTRACT

Machine learning pipeline potentially consists of several stages of operations like data preprocessing, feature engineering and machine learning model training. Each operation has a set of hyper-parameters, which can become irrelevant for the pipeline when the operation is not selected. This gives rise to a hierarchical conditional hyper-parameter space. To optimize this mixed continuous and discrete conditional hierarchical hyper-parameter space, we propose an efficient pipeline search and configuration algorithm which combines the power of Reinforcement Learning and Bayesian Optimization. Empirical results show that our method performs favorably compared to state of the art methods like Auto-sklearn , TPOT, Tree Parzen Window, and Random Search.

研究の動機と目的

  • 機械学習パイプラインにおける複雑で条件付き、階層的なハイパーパramータースペースの最適化という課題に対処すること。
  • パイプライン構成とハイパーパramーターチューニングを別々に扱う、または条件付き空間をフラットな表現で扱う既存のAutoMLシステムの改善。
  • 最小限の計算コストで、離散的および連続的の混合された条件付き探索空間を効率的に探索する手法の開発。
  • 非専門家ユーザーが、エキスパートを介さずに自動的に機械学習パイプラインを構築・設定できるようにすること。
  • 標準的なハードウェア上での実用的デプロイメントを想定した、軽量で効率的な実装の提供。

提案手法

  • パイプライン探索とハイパーパラメータ設定の問題を、アクションがパイプラインコンポonentとハイパーパラメータの選択に対応する階層的マルコフ決定過程(MDP)として定式化する。
  • Q学習フレームワーク内にベイズ最適化を組み込み、各選択されたパイプラインにおけるハイパーパラメータ設定の探索を支援する。
  • 最適化を2つのサブタスクに分解する:(1) RLを用いたパイプラインコンポーネントの選択、(2) 各アクティブなパイプラインにおけるBOによるハイパーパラメータ最適化。
  • アノサス・サンプリングとパルゼン窓密度推定器を用いて条件付きハイパーパラメータ分布をモデル化し、効率的なプロポーザル生成を可能にする。
  • ハイパーパラメータの探索と活用のトレードオフを、Hyperbandの逐次ハーフアップ戦略にインspiredしたリソース配分問題として定式化する。
  • 標準的なハードウェア上で効率的な実行を可能にする、`reinbo`という軽量なRパッケージを実装し、条件付き空間における離散的および連続的ハイパーパラメータを両方サポートする。

実験結果

リサーチクエスチョン

  • RQ1ベイズ最適化を強化学習フレームワークに効果的に統合することで、パイプライン構成とハイパーパラメータの共同最適化が可能になるか?
  • RQ2提案手法ReinBoは、Auto-sklearn、TPOT、およびランダムサーチといった最先端のAutoMLシステムと比較して、性能と効率の面でどのように差をつけるか?
  • RQ3ハイパーパラメータースペースの階層的・条件付き構造が、AutoMLアルゴリズムのスケーラビリティと収束性に及ぼす影響はどの程度か?
  • RQ4BOをRLに統合することで、パイプライン探索におけるサンプル効率が向上し、高価なモデル評価回数が削減されるか?
  • RQ5予測精度と計算コストの観点から、ReinBoの性能は多様なデータセットにおいてどのように変動するか?

主な発見

  • ReinBoは15のベンチマークデータセットにおいて、ランダムサーチ、TPE、Auto-sklearn、TPOT-light、TPOTを上回り、マン・ホイットニーU検定で有意水準α=0.05で5つの比較で勝利した。
  • ReinBoは15のデータセットのうち10つで中央値性能が最良であり、特に糖尿病およびozone-level-8hrデータセットで最小の平均誤分類誤差(mmce)を達成した。
  • 10回の反復におけるmmceのボックスプロットから、四分位範囲が狭いことが示され、性能の安定性が裏付けられた。
  • Auto-sklearnやTPOTよりも著しく短い計算時間で実行され、1データセットあたりの平均実行時間がランダムサーチ未満であり、TPOT-lightと同等の性能を示した。
  • ReinBoの最終パイプラインで最も頻繁に選択されたパイプラインコンポーネントは、スケーリング(51.8%)、FilterAnova(42.0%)、ksvm(55.2%)であり、これらの構成に強い傾向が見られた。
  • ksvmの相対頻度が55.2%、rangerが40.2%に達したことは、多様なデータタイプにおいて高性能な分類器を効果的に同定できたことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。