Skip to main content
QUICK REVIEW

[論文レビュー] Tune As You Scale: Hyperparameter Optimization For Compute Efficient Training

Abraham J. Fetterman, Ellie Kitanidis|arXiv (Cornell University)|Jun 13, 2023
Machine Learning and Data Classification被引用数 4
ひとこと要約

CARBSは、パフォーマンス-コストパラメーターフロンティアの周辺で局所的な探索を実行することで、大規模なディープラーニングモデルのための効率的で自動化されたハイパーパramータチューニングを可能にするコストに配慮したベイジアン最適化アルゴリズムである。この手法はすべてのハイパーパramータに対してスケーリング則を同定し、より少ない計算資源でChinchillaのモデルスケーリング結果を再現するとともに、PPOチューニングのみでProcGenベンチマークを完全に解決した。これは、ベースラインと比較して優れたサンプル効率性と頑健性を示している。

ABSTRACT

Hyperparameter tuning of deep learning models can lead to order-of-magnitude performance gains for the same amount of compute. Despite this, systematic tuning is uncommon, particularly for large models, which are expensive to evaluate and tend to have many hyperparameters, necessitating difficult judgment calls about tradeoffs, budgets, and search bounds. To address these issues and propose a practical method for robustly tuning large models, we present Cost-Aware Pareto Region Bayesian Search (CARBS), a Bayesian optimization algorithm that performs local search around the performance-cost Pareto frontier. CARBS does well even in unbounded search spaces with many hyperparameters, learns scaling relationships so that it can tune models even as they are scaled up, and automates much of the "black magic" of tuning. Among our results, we effectively solve the entire ProcGen benchmark just by tuning a simple baseline (PPO, as provided in the original ProcGen paper). We also reproduce the model size vs. training tokens scaling result from the Chinchilla project (Hoffmann et al. 2022), while simultaneously discovering scaling laws for every other hyperparameter, via an easy automated process that uses significantly less compute and is applicable to any deep learning problem (not just language models).

研究の動機と目的

  • 大規模なディープラーニングモデルにおけるハイパーパramータチューニングの非効率性と人的作業の負担を軽減すること。特に、評価コストが高く、スケーリング関係が非自明な状況を想定する。
  • 手動による探索範囲やトレーニング予算の指定を排除することで、チューニングプロセスを自動化し、ハイパーパramータ選定におけるバイアスや再現不可能性を低減すること。
  • すべてのハイパーパramータに対してコスト依存のスケーリング則を学習することで、高次元空間における頑健でスケーラブルなハイパーパramータ最適化を実現すること。
  • Chinchillaプロジェクトのような複雑なスケーリング行動を、著しく少ない計算資源で自動的に再現できること。
  • CARBSでチューニングされた単純なベースラインが、強化学習、言語モデリング、画像分類を含む多様なタスクで最先端の性能を達成できることを示すこと。

提案手法

  • CARBSは、ハイパーパラメータの関数としてモデルのパフォーマンスとトレーニングコスト(時間)を同時にモデリングするため、ガウス過程(GP)のスレーブモデルを用いる。
  • 現在のパフォーマンス-コストパラメーターフロンティアの周辺で局所的なベイジアン最適化を実行することで、高次元空間におけるサンプル効率を向上させる。
  • 獲得関数は、パラメーターフロンティアを基準とした期待改善(EI-PF)を採用し、コストに配慮した戦略を組み込み、効率的で高パフォーマンスな設定を優先する。
  • 学習率、バッチサイズ、トレーニングトークン数などのハイパーパラメータに対して、動的かつ自動的にスケーリング則を学習することで、より大きなモデルへの外挿を可能にする。
  • 低コスト領域と高パフォーマンス領域の両方の探索をバランスさせるために、ランダムなコストクラムピング機構を導入し、観測ノイズを低減するためのリサンプリングを実装する。
  • 各ハイパーパラメータの初期探索中心点のみを必要とし、事前の探索範囲や予算制約の指定が不要であるため、完全に自動化されたフレームワークを実現する。

実験結果

リサーチクエスチョン

  • RQ1高次元かつ評価コストの高い大規模なディープラーニングモデルに対して、ベイジアン最適化アルゴリズムが効率的にチューニングできるか?特にスケーリングアップの文脈で。
  • RQ2手動による干渉なしに、トレーニングトークン数やエポック数を含むすべてのハイパーパラメータのスケーリング則を自動で発見できるか?
  • RQ3コストに配慮した、パラメーターフロンティアに焦点を当てた局所的探索戦略が、グローバル探索や非コスト配慮型のベイジアン最適化に比べ、サンプル効率性と頑健性において優れているか?
  • RQ4CARBSでチューニングされた単純なベースライン(例:PPO)が、ProcGenのような挑戦的なベンチマークで最先端の性能を達成できるか?
  • RQ5CARBSは、従来の手法よりも著しく少ない計算資源で、Chinchillaプロジェクトのような複雑なスケーリング則(例:モデルサイズ対トレーニングトークン数)を再現できるか?

主な発見

  • 言語モデリングタスクにおいて、CARBSはASHA や BOHB といった他のチューニングアルゴリズムを上回る中央値のパフォーマンスと低い分散を達成した。
  • MuJoCo Ant-v4強化学習タスクにおいて、CARBSは他のアルゴリズムよりもパラメーターフロンティアに近い観測を多数得ており、サンプル効率性とスレーブモデルの品質の優位性を示した。
  • CARBSは、PPOベースラインのチューニングのみでProcGenベンチマーク全体を完全に解決した。これは、単純なモデルに対しても、体系的なハイパーパラメータチューニングによって画期的な性能が引き出せることを示している。
  • CARBSは、Chinchillaプロジェクト(Hoffmann et al., 2022)で報告されたモデルサイズ対トレーニングトークン数のスケーリング則を再現しただけでなく、同時にすべての他のハイパーパラメータについてもスケーリング則を同定した。これらは1回の自動チューニング実行内で達成された。
  • アブレーションスタディの結果、パラメーターフロンティアに基づく獲得関数、コストクラムピング、リサンプリングといった主要な構成要素を削除すると、性能が著しく低下することが確認され、各設計選択の必要性が裏付けられた。
  • CARBSは、探索範囲や予算の指定を一切必要としないため、完全に自動化されており、実務でしばしば固定されるようなトレーニング期間などのハイパーパラメータを含む、あらゆるディープラーニング問題に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。