Skip to main content
QUICK REVIEW

[論文レビュー] Embedded hyper-parameter tuning by Simulated Annealing

Matteo Fischetti, Matteo Stringher|arXiv (Cornell University)|Jun 4, 2019
Model Reduction and Neural Networks参考文献 12被引用数 13
ひとこと要約

この論文では、勾配情報に基づく移動とSAの受容基準を用いて、トレーニング中にリアルタイムで学習率を動的に調整する、埋め込み型ハイパーパrameterチューニング手法を提案する。シミュレーテッドアニーリング(SA)を確率的勾配降下法(SGD)内に統合し、候補となるハイパーパrameterをリアルタイムで評価することで、ResNet34およびVGG16のCIFAR-10において、標準的なSGDに比べて最大1-2%高い検証精度を達成し、一般化性能が向上する。

ABSTRACT

We propose a new metaheuristic training scheme that combines Stochastic Gradient Descent (SGD) and Discrete Optimization in an unconventional way. Our idea is to define a discrete neighborhood of the current SGD point containing a number of "potentially good moves" that exploit gradient information, and to search this neighborhood by using a classical metaheuristic scheme borrowed from Discrete Optimization. In the present paper we investigate the use of a simple Simulated Annealing (SA) metaheuristic that accepts/rejects a candidate new solution in the neighborhood with a probability that depends both on the new solution quality and on a parameter (the temperature) which is modified over time to lower the probability of accepting worsening moves. We use this scheme as an automatic way to perform hyper-parameter tuning, hence the title of the paper. A distinctive feature of our scheme is that hyper-parameters are modified within a single SGD execution (and not in an external loop, as customary) and evaluated on the fly on the current minibatch, i.e., their tuning is fully embedded within the SGD algorithm. The use of SA for training is not new, but previous proposals were mainly intended for non-differentiable objective functions for which SGD is not applied due to the lack of gradients. On the contrary, our SA method requires differentiability of (a proxy of) the loss function, and leverages on the availability of a gradient direction to define local moves that have a large probability to improve the current solution. Computational results on image classification (CIFAR-10) are reported, showing that the proposed approach leads to an improvement of the final validation accuracy for modern Deep Neural Networks such as ResNet34 and VGG16.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)におけるハイパーパrameterチューニング、特に学習率選定の課題に取り組むこと。これは通常、手動または外部ループで行われる。
  • 外部ループを必要とせず、1回のSGDトレーニングラン内にハイパーパrameter探索を直接統合する手法を開発すること。
  • 勾配情報を用いてハイパーパrameter空間における有望な局所的移動を定義し、ランダムまたはグリッドベースの手法と比較して、探索効率を向上させること。
  • ランダムシードが最適化経路および最終的な一般化性能に顕著に影響を与えるという点で、チューナブルなハイパーパrameterとしての役割を調査すること。
  • SAベースのハイパーパrameterチューニングが、現代のDNNアーキテクチャにおいて、最終的な検証精度および損失の観点で標準的なSGDを上回るかどうかを評価すること。

提案手法

  • 現在のSGDの点の周囲に、勾配情報で誘導された有望な移動を定義する離散的近傍領域(例:学習率)を定義する。
  • 時間に応じて変化する温度パラメータを用いて、損失の変化に基づき、候補となるハイパーパrameter変更を確率的に受容または拒否するためのシミュレーテッドアニーリング(SA)を用いる。
  • メトロポリス受容基準を適用:Δが損失の増加量、Tが温度であるとき、確率exp(−Δ/T)で劣化する移動を受容する。温度Tは時間とともに減少する。
  • 各候補となるハイパーパrameter変更を、現在のミニバッチ上でリアルタイムに評価することで、全データセットを再評価する必要なく、即時チューニングを可能にする。
  • 全プロセスを1つのSGDトレーニングループ内に統合し、外部のハイパーパrameter探索ループの必要性を排除する。
  • ランダムシードを外部からチューニング可能なハイパーパラメータとして扱い、最適化経路および最終的なモデル性能に顕著な影響を与えることから。

実験結果

リサーチクエスチョン

  • RQ1シミュレーテッドアニーリングは、外部ループではなく1回のSGDトレーニングラン内において、学習率などのハイパーパラメータを効果的にチューニングするために使用可能か?
  • RQ2SGD内にSAベースのハイパーパラメータチューニングを埋め込むことで、標準的なSGDと比較して、画像分類ベンチマークにおける一般化性能が向上するか?
  • RQ3SAを用いたハイパーパラメータチューニングにおいて、ランダムシードが最適化経路および最終的なモデル性能にどのように影響を与えるか?
  • RQ4ハイパーパラメータ空間における勾配情報に基づく移動は、純粋にランダムまたはグリッドベースのハイパーパラメータ選択と比較して、探索効率を向上させるか?
  • RQ5提案手法は、手動によるハイパーパラメータチューニングの必要性をどの程度低減できるか、かつモデルの精度を維持または向上させられるか?

主な発見

  • 提案されたSGD-SA手法は、CIFAR-10のResNet34およびVGG16の両方において、標準的なSGDよりも顕著に低い最終的な検証損失を達成しており、全シードにおいて改善が観察された。
  • ResNet34では、10個のランダムシードのうち最良の実行結果を考慮した場合、SGD-SAは標準的なSGDに比べて1-2%高い検証精度を達成した。
  • SGD-SAのトレーニング精度は標準的なSGDよりも収束が遅いが、最終的な検証精度は一貫して高く、一般化性能の向上を示している。
  • 期待通り、劣化する移動の受容確率は時間とともに減少しており、初期エポックでは高い受容確率、後期エポックではほぼゼロの受容確率を示している。
  • 異なるランダムシードは、SGD-SAにおいて顕著に異なる最適化経路をもたらし、シードがモデル性能に顕著に影響を与える強力なハイパーパラメータとして機能することが示された。
  • 微分可能なプロキシ損失関数の使用により、勾配に基づく移動生成が可能となり、SAの受容ルールにより非最適な移動の探索が可能になり、モデルのロバスト性および一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。