Skip to main content
QUICK REVIEW

[論文レビュー] A Gradient-based Bilevel Optimization Approach for Tuning Hyperparameters in Machine Learning

Ankur Sinha, Tanmay Khandait|arXiv (Cornell University)|Jul 21, 2020
Machine Learning and Data Classification参考文献 22被引用数 11
ひとこと要約

本稿では、勾配に基づく二段階最適化手法を提案し、ハイパーパramータチューニングに応用する。この手法は、下位問題の最適値関数(φマッピング)を近似することで、二段階最適化問題を1段階の制約付き最適化問題に変換し、増大ラグランジュ法により解く。このアプローチにより計算コストを著しく削減でき、グリッドサーチやベイズ最適化と比較して、ハイパーパramータ数が増加するに従い、下位問題の最適化回数を最大100倍も削減しつつ、優れたテスト性能を達成する。

ABSTRACT

Hyperparameter tuning is an active area of research in machine learning, where the aim is to identify the optimal hyperparameters that provide the best performance on the validation set. Hyperparameter tuning is often achieved using naive techniques, such as random search and grid search. However, most of these methods seldom lead to an optimal set of hyperparameters and often get very expensive. In this paper, we propose a bilevel solution method for solving the hyperparameter optimization problem that does not suffer from the drawbacks of the earlier studies. The proposed method is general and can be easily applied to any class of machine learning algorithms. The idea is based on the approximation of the lower level optimal value function mapping, which is an important mapping in bilevel optimization and helps in reducing the bilevel problem to a single level constrained optimization task. The single-level constrained optimization problem is solved using the augmented Lagrangian method. We discuss the theory behind the proposed algorithm and perform extensive computational study on two datasets that confirm the efficiency of the proposed method. We perform a comparative study against grid search, random search and Bayesian optimization techniques that shows that the proposed algorithm is multiple times faster on problems with one or two hyperparameters. The computational gain is expected to be significantly higher as the number of hyperparameters increase. Corresponding to a given hyperparameter most of the techniques in the literature often assume a unique optimal parameter set that minimizes loss on the training set. Such an assumption is often violated by deep learning architectures and the proposed method does not require any such assumption.

研究の動機と目的

  • グリッドサーチやランダムサーチなどの従来のハイパーパramータチューニング手法の非効率さと高コストを解消すること。
  • 一意の最適パラメータ集合を仮定する必要があるなど、制限的な仮定に依存する既存の二段階最適化手法の限界を克服すること。
  • ヘシアンの近似や強い仮定を必要とせず、任意の機械学習モデルに適用可能な一般化された1次最適化手法を開発すること。
  • φマッピングの近似を用いて二段階最適化問題を1段階の制約付き最適化問題に変換することで、ハイパーパramータ最適化における計算負荷を軽減すること。
  • ベンチマークデータセットにおいて、ベイズ最適化やグリッドサーチと比較して、収束速度が速く、一般化性能が優れていること。

提案手法

  • ハイパーパラメータ最適化を二段階最適化問題として定式化:上位問題では検証損失を最小化し、下位問題では訓練損失を最小化する。
  • 下位問題の最適値関数(φマッピング)を近似する。この関数はハイパーパラメータを最適訓練損失にマッピングするものであり、二段階最適化問題を1段階の制約付き最適化問題に還元可能である。
  • 得られた1段階の制約付き最適化問題を解くために増大ラグランジュ法を用いる。これにより、効率的かつ安定した収束が可能になる。
  • サンプリングと有限差分を用いてφマッピングを推定し、ヘシアン計算や反復的勾配近似の必要性を回避する。
  • φマッピングの近似を増大ラグランジュフレームワークに統合し、計算コストを下位問題の最適化回数に加え、増大ラグランジュ更新のための追加ステップ数として追跡する。
  • ハイパーパラメータ数を増加させてもスケーラブルなまま保つために、φマッピングのサンプリングサイズと増大ラグランジュ副問題の変数数にのみ影響を与えるように設計する。

実験結果

リサーチクエスチョン

  • RQ1ヘシアンの近似や反復的勾配推定の計算負荷を回避できる勾配ベースの二段階最適化手法を開発できるか?
  • RQ2φマッピングの近似により、各ハイパーパラメータに対して一意の最適パラメータ集合を仮定しないまま、効率的かつ正確なハイパーパラメータチューニングが可能か?
  • RQ3ハイパーパラメータの次元が変化する状況下で、グリッドサーチ、ランダムサーチ、ベイズ最適化と比較して、計算効率とテスト性能にどのような差が生じるか?
  • RQ4ハイパーパラメータ数が増加しても、この手法が性能とスケーラビリティを維持できるか?
  • RQ5φマッピングの近似により、最適ハイパーパラメータに到達するまでに必要な下位問題の最適化回数は、どの程度削減されるか?

主な発見

  • MNISTデータセット(1または2つのハイパーパラメータ)の全6テストケースにおいて、提案手法(PVM)はグリッドサーチやベイズ最適化を上回る、最小のテストセット損失を達成した。
  • 1つのハイパーパラメータの場合、PVMは平均で10 (+4)回の下位問題最適化で十分だったが、グリッドサーチでは100~1000回、ベイズ最適化では50回を要した。PVMはより優れたテスト性能を達成した。
  • 2つのハイパーパラメータの場合、PVMは50 (+4)回の下位問題最適化で十分だったが、グリッドサーチでは1000回必要だった。PVMは優れた一般化性能を示した。
  • MNIST 10000(1ハイパーパラメータおよび2ハイパーパラメータケース)の収束プロットから、増大ラグランジュ最適化における一貫性ある収束が確認された。
  • ハイパーパラメータ数が増加してもPVMは高い効率を維持した。φマッピングのサンプリングサイズに比例して線形にスケーリングされ、増大ラグランジュ副問題への変数追加数も僅かに増えるにとどまった。
  • この手法は、各ハイパーパラメータに対して一意の最適モデルパラメータ集合を仮定しない。深層学習で一般的な非一意解に対してもロバストである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。