Skip to main content
QUICK REVIEW

[論文レビュー] Random Search Hyper-Parameter Tuning: Expected Improvement Estimation and the Corresponding Lower Bound

Dan Navon, Alex Bronstein|arXiv (Cornell University)|Aug 17, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

本稿は、ランダムなハイパーパramータサーチにおける追加イテレーションによる期待精度向上を推定する統計的に厳密な手法を提案する。Dvoretzky–Kiefer–Wolfowitz (DKW) 不等式を用いて、推定誤差を高確率で $ O\left(\sqrt{\frac{\log k}{k}}\right) $ に制限する。さらに、任意の推定器に対する最良の平均絶対誤差の理論的下界 $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ を確立し、ランダムサーチによるハイパーパramータチューニングにおける初めてのこのような下界を提供する。

ABSTRACT

Hyperparameter tuning is a common technique for improving the performance of neural networks. Most techniques for hyperparameter search involve an iterated process where the model is retrained at every iteration. However, the expected accuracy improvement from every additional search iteration, is still unknown. Calculating the expected improvement can help create stopping rules for hyperparameter tuning and allow for a wiser allocation of a project's computational budget. In this paper, we establish an empirical estimate for the expected accuracy improvement from an additional iteration of hyperparameter search. Our results hold for any hyperparameter tuning method which is based on random search \cite{bergstra2012random} and samples hyperparameters from a fixed distribution. We bound our estimate with an error of $O\left(\sqrt{\frac{\log k}{k}} ight)$ w.h.p. where $k$ is the current number of iterations. To the best of our knowledge this is the first bound on the expected gain from an additional iteration of hyperparameter search. Finally, we demonstrate that the optimal estimate for the expected accuracy will still have an error of $\frac{1}{k}$.

研究の動機と目的

  • ランダムサーチにおけるハイパーパramータサーチの追加イテレーションによる期待精度向上を推定すること。
  • 固定されたハイパーパramータ分布を仮定したランダムサーチにおいて、期待改善度推定器の高確率誤差バウンドを提供すること。
  • 任意のこのような推定器に対する、最も良い推定誤差の理論的下界を確立すること。
  • 限られた計算リソースの下で、劣化収穫の定量的評価を可能にすることで、データ駆動型の停止ルールを可能にすること。
  • ニューラルネットワークのハイパーパramータチューニングにおける標準化された計算リソース配分の欠如に対処すること。

提案手法

  • k 個のランダムハイパーパramータ試行から得られるモデル精度の経験的累積分布関数 $ \widehat{F}_X $ を、非パラメトリックに推定するために Dvoretzky–Kiefer–Wolfowitz (DKW) 不等式を用いる。
  • 密度推定を避けるために、経験的分布関数の逆関数を用いて期待改善度を推定する。
  • 期待改善度推定器の誤差バウンドとして、高確率で $ O\left(\sqrt{\frac{\log k}{k}}\right) $ を導出する。
  • I が平均と標準偏差の凸関数であることに着目し、$ I(\widehat{\mu}, \widehat{\sigma}, \alpha) $ と $ I(\mu, \sigma, \alpha) $ の期待値の乖離をバウンドすることで、最適推定器の推定誤差を分析する。
  • 集中不等式とカイ二乗分布の性質を用いて、任意の推定器の平均絶対誤差の下界を導出する。
  • 正規分布の仮定の下で、最良の推定器が $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ よりも良い誤差を達成できないことを示す。

実験結果

リサーチクエスチョン

  • RQ11回の追加ランダムハイパーパramータサーチイテレーションによるモデル精度の期待向上は何か?
  • RQ2k 個の過去の評価値のみを用いて、この期待向上度を誤差バウンドで推定できるか?
  • RQ3ランダムサーチにおける期待向上度推定器の平均絶対誤差の最もタイトな下界は何か?
  • RQ4推定誤差は、イテレーション数 k の関数として高確率で定量的に評価できるか?
  • RQ5推定誤差は k に対してどのようにスケーリングされ、このような推定器の根本的な精度限界は何か?

主な発見

  • 追加のランダムサーチイテレーションによる期待向上度は、高確率で誤差 $ O\left(\sqrt{\frac{\log k}{k}}\right) $ で推定可能である。
  • 期待向上度の最良の推定器の平均絶対誤差は、下界 $ \frac{\sigma^2}{2\sqrt{2\pi}k} \cdot \left[1 - F_X(\alpha)\right] $ で抑えられる。
  • $ \alpha \geq \mu + \sqrt{\frac{3}{2}}\sigma $ の場合、下界は $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ に改善される。
  • 推定誤差は $ \frac{1}{k} $ よりも良くならないため、このような推定器の精度の根本的限界が確立される。
  • 提案された推定器は非パラメトリックであり、精度の背後にある分布 $ f_X $ に関する仮定を必要としない。
  • 結果として、限られた計算リソースの下でのハイパーパramータチューニングにおける適応的停止ルールの理論的基盤が提供される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。