[論文レビュー] Model-based Asynchronous Hyperparameter and Neural Architecture Search
この論文では、ガウス過程に基づくベイズ最適化と非同期なマルチファシリティスケジューリングを組み合わせた、モデルベースの非同期ハイパラメータおよびニューラルアーキテクチャサーチ手法A-BOHBを提案する。ハイパラメータとリソースレベルを同時にモデリングし、保留中の評価をファンタジー化することで、特に高価なディープラーニングベンチマークにおいて、同期型およびランダム非同期ベースラインと比較して収束が速く、レグルゲーション性能が優れている。
We introduce a model-based asynchronous multi-fidelity method for hyperparameter and neural architecture search that combines the strengths of asynchronous Hyperband and Gaussian process-based Bayesian optimization. At the heart of our method is a probabilistic model that can simultaneously reason across hyperparameters and resource levels, and supports decision-making in the presence of pending evaluations. We demonstrate the effectiveness of our method on a wide range of challenging benchmarks, for tabular data, image classification and language modelling, and report substantial speed-ups over current state-of-the-art methods. Our new methods, along with asynchronous baselines, are implemented in a distributed framework which will be open sourced along with this publication.
研究の動機と目的
- 分散環境における同期化ボトル neck による非効率な同期型ハイパラメータおよびニューラルアーキテクチャサーチ(HNAS)の問題を解消すること。
- しばしば最先端性能に到達しない、非同期Hyperbandのバリアントにおけるランダムサンプリングの限界を克服すること。
- 複数のリソースレベルおよび保留中の評価を考慮した、非同期意思決定を可能にする原理的でモデルベースのアプローチを開発すること。
- ハイパラメータとリソースレベルの共同確率的モデリングを活用することで、HNASにおけるサンプル効率性と壁時刻性能を向上させること。
- ベイズ最適化や分散システムに詳しくない実務家が実用的でスケーラブルかつ効率的な自動機械学習を実現できるようにすること。
提案手法
- ハイパラメータとリソースレベル(例:訓練エポック数)の両方を同時にモデリングする共同ガウス過程(GP)スレーブモデルを導入する。
- 確率的推論を用いて、完了済みおよび保留中の評価を考慮した上で、より高いリソースレベルでの性能を予測する。
- 保留中の設定の結果を模擬する「ファンタジー」サンプリングを適用し、すべてのワーカーの完了を待たずに非同期意思決定を可能にする。
- このモデルを非同期Hyperband(HB)スケジューリングフレームワークに統合し、ランダムな設定サンプリングの代わりにモデル駆動の取得関数を導入する。
- 次に評価する設定を選択するために、期待改善(EI)または改善確率(PI)に基づく取得関数を採用する。
- 初期の低ファシリティ評価に基づいて、有望な設定を高いリソースレベルに段階的に昇格させるマルチファシリティ最適化を支援する。
実験結果
リサーチクエスチョン
- RQ1ランダムまたは同期型ベースラインと比較して、モデルベースのアプローチは非同期ハイパラメータおよびニューラルアーキテクチャサーチにおけるサンプル効率性と壁時刻性能をどのように向上させるか?
- RQ2保留中の評価が存在する非同期環境において、ハイパラメータとリソースレベルの共同モデリングは意思決定にどのように影響を与えるか?
- RQ3ファンタジーに基づく推論を用いたガウス過程スレーブモデルは、非同期HBのバリアントにおいてランダム設定サンプリングを上回る性能を発揮するか?
- RQ4高価なディープラーニングベンチマークにおいて、A-BOHBは同期型BOHB や ASHA といった最先端手法と比較して、レグルゲーションをどの程度低減できるか?
- RQ5特に計算リソースが限られた環境下で、A-BOHBの性能は並列ワーカー数の変動に対してどのようにスケーリングするか?
主な発見
- CIFAR-10のResNetにおいて、A-BOHBはA-HBが2倍のワーカーを用いる場合とほぼ同じ壁時刻で、検証誤差レグルゲーションを $10^{-2}$(精度差1%)にまで低下させた。
- LSTM言語モデリング(WikiText-2)において、A-BOHBは同期型BOHB や ASHA を上回り、より速く、計算負荷を抑えながら競争力のある性能に到達した。
- 同等の結果を得るために、A-BOHBはランダムサンプリングベースの非同期HBバリアント(例:ASHA)と比較して、計算リソースを半分に抑えながらも、同等またはそれ以上の性能を達成した。
- 同期化オーバーヘッドを顕著に低減し、同じ壁時刻内により多くの設定を高いリソースレベルに昇格させられるようになった。
- テーブルおよび画像分類ベンチマークにおいて、A-BOHBは最先端の同期型および非同期HNAS手法と比較して、一貫した高速化と低いレグルゲーションを示した。
- 共同GPモデルにより、リソースレベル間での効果的な補間が可能となり、保留中の評価からの不完全なデータでも、頑健な意思決定を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。