Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Large-Scale Hyperparameters via Automated Learning Algorithm

Bin Gu, Guodong Liu|arXiv (Cornell University)|Feb 17, 2021
Machine Learning and Data Classification参考文献 34被引用数 4
ひとこと要約

本稿では、ブラックボックス法と勾配ベース手法を組み合わせる新しいハイパーパramータ最適化手法HOZOGを提案する。ゼロ次勾配(zeroth-order hyper-gradients)を用いることで、バックプロパゲーションによる勾配計算を必要とせず、大規模なハイパーパrameter(最大1,250個)のスケーラブルで効率的かつ柔軟なチューニングを可能にする。本手法は、勾配計算を必要とせず、非滑らかまたは複雑な関数に対しても適用可能であり、収束速度において既存手法を上回る。効果性、効率性、スケーラビリティ、単純性、柔軟性(E2S2F)の面で最先端の性能を達成する。

ABSTRACT

Modern machine learning algorithms usually involve tuning multiple (from one to thousands) hyperparameters which play a pivotal role in terms of model generalizability. Black-box optimization and gradient-based algorithms are two dominant approaches to hyperparameter optimization while they have totally distinct advantages. How to design a new hyperparameter optimization technique inheriting all benefits from both approaches is still an open problem. To address this challenging problem, in this paper, we propose a new hyperparameter optimization method with zeroth-order hyper-gradients (HOZOG). Specifically, we first exactly formulate hyperparameter optimization as an A-based constrained optimization problem, where A is a black-box optimization algorithm (such as deep neural network). Then, we use the average zeroth-order hyper-gradients to update hyperparameters. We provide the feasibility analysis of using HOZOG to achieve hyperparameter optimization. Finally, the experimental results on three representative hyperparameter (the size is from 1 to 1250) optimization tasks demonstrate the benefits of HOZOG in terms of simplicity, scalability, flexibility, effectiveness and efficiency compared with the state-of-the-art hyperparameter optimization methods.

研究の動機と目的

  • 現代の機械学習モデルにおける大規模なハイパーパrameter(最大1,250)の最適化という課題に対処すること。
  • ブラックボックス最適化(単純さ、柔軟性)と勾配ベース手法(効率性、スケーラビリティ)の長所をハイパーパrameterチューニングにおいて統合すること。
  • 多様な学習アルゴリズムやハイパーパrameterのサイズに適応可能な、効果的で、効率的で、スケーラブルで、単純で、柔軟な(E2S2F)手法を開発すること。
  • 正確な勾配計算が失敗する非滑らかまたは複雑な設定においてもハイパーパrameter最適化を可能にすること。

提案手法

  • ハイパーパrameter最適化を、A(例:深層ニューラルネットワークなど)というブラックボックスアルゴリズムに基づく制約付き最適化問題として定式化する。
  • バックプロパゲーションによる明示的勾配計算を必要とせず、ハイパーパラメータの勾配方向を推定するためのゼロ次勾配(ZOHG)を導入する。
  • 平均ゼロ次勾配を用いて勾配降下法によりハイパーパラメータを更新することで、ブラックボックス的な柔軟性と勾配ベースの効率性を両立する。
  • 外部目的関数のリプシッツ連続性の下で理論的妥当性を確立する。
  • 有限差分近似を用いてブラックボックス的な方法でハイパーパラメータ勾配を推定し、モデル固有の勾配実装の必要性を回避する。
  • ハイパーパラメータが固定された際の最適なモデル学習を前提に、検証誤差を最小化する二段階最適化問題に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1ブラックボックス最適化の単純さと柔軟性を継承しながら、勾配ベース手法の効率性とスケーラビリティを達成できるハイパーパラメータ最適化手法は可能か?
  • RQ2正確な勾配計算に依存せずに、高次元のハイパーパラメータ空間(最大1,250)に対しても効果的なハイパーパラメータチューニングが可能か?
  • RQ3ゼロ次勾配ハイパーパラメータ勾配法は、最先端のブラックボックスおよび勾配ベース手法と比較して、収束速度と一般化性能の面で優れているか?
  • RQ4本手法は、従来の勾配手法が失敗する非滑らかまたは不連続な目的関数に対しても適用可能か?

主な発見

  • 1,250個のハイパーパラメータに対して、HOZOGは初期学習段階でREV(正確な勾配法)を上回る収束速度を示し、1回のハイパーパラメータ勾配計算に約24秒を要したのに対し、REVは約40秒を要した。
  • 500および1,250のハイパーパラメータサイズの両方において、suboptimality、勾配ノルム、テスト誤差の観点で、HOZOGはランダムサーチ(RS)およびBOHBを上回った。
  • GPBO、FOR、HOAGなど、実装上の制限により1,250個を超えるハイパーパラメータサイズでは失敗する手法とは異なり、HOZOGはそのスケーラビリティを優れて示した。
  • データハイパーハイジーニングタスクにおいても優れた性能を示し、正確な勾配手法が適用できない非滑らか設定でも頑健性を示した。
  • RFHOや他の勾配ベース手法とは異なり、カスタム勾配コードの必要がないため、高い柔軟性と単純さを維持した。
  • 理論的分析により、リプシッツ連続性の下で妥当性が保証され、連続な目的関数に対して収束保証が得られることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。