Skip to main content
QUICK REVIEW

[論文レビュー] Eve: A Gradient Based Optimization Method with Locally and Globally Adaptive Learning Rates

Hiroaki Hayashi, Jayanth Koushik|arXiv (Cornell University)|Nov 4, 2016
Stochastic Gradient Optimization Techniques参考文献 11被引用数 14
ひとこと要約

Eveは、目的関数の変動と非最適性から導出されるフィードバック係数dtを用いて、グローバルに適応する学習率を導入することで、Adamを改善する新しい適応的最適化手法である。実験的に、手動での減衰ハイパーパrameterのチューニングを必要とせずに、CNNおよびRNNにおいてAdamや学習率減衰戦略よりも高速な収束と優れた性能を達成している。

ABSTRACT

Adaptive gradient methods for stochastic optimization adjust the learning rate for each parameter locally. However, there is also a global learning rate which must be tuned in order to get the best performance. In this paper, we present a new algorithm that adapts the learning rate locally for each parameter separately, and also globally for all parameters together. Specifically, we modify Adam, a popular method for training deep learning models, with a coefficient that captures properties of the objective function. Empirically, we show that our method, which we call Eve, outperforms Adam and other popular methods in training deep neural networks, like convolutional neural networks for image classification, and recurrent neural networks for language tasks.

研究の動機と目的

  • Adamのような適応的最適化手法におけるグローバル学習率の手動チューニングの課題に対処すること。
  • 目的関数の挙動に基づいてグローバル学習率を動的に適応させることで、深層ニューラルネットワークの学習収束性と性能を向上させること。
  • 慎重なハイパーパrameterチューニングを必要とするヒューリスティックな学習率減衰スケジュールへの依存を減らすこと。
  • 局所的なパラメータごとの適応と、目的関数からのフィードバックを用いたグローバル学習率の適応を統合する手法を開発すること。

提案手法

  • Eveは、Adamを変更し、スカラー係数dtを導入してグローバル学習率をαt = α1/dtとして適応的に調整する。
  • 係数dtは、2つの性質に基づいて計算される:連続する目的関数値の変動(|ft − ft−1|)と非最適性(f⋆ − ft)。
  • 高い変動はdtを低下させ、結果として学習率を小さくする。高い非最適性はdtを増加させ、結果として学習率を大きくする。
  • dtの計算には、目的関数の変動と非最適性のランニング平均が用いられ、ハイパーパramータβ3とcがその感度を制御する。
  • Eveは元のAdamの更新則を維持するが、固定されたグローバル学習率αtを、αt = α1/dtという適応的学習率に置き換える。
  • アルゴリズムは計算的に効率的であり、標準Adamに比べてメモリオーバーヘッドが最小限である。

実験結果

リサーチクエスチョン

  • RQ1固定または減衰する学習率と比較して、グローバルに適応する学習率は、深層ニューラルネットワークにおける最適化性能を向上させるか?
  • RQ2目的関数の変動と非最適性からのフィードバックを組み込むことで、収束が速くなり、一般化性能が向上するか?
  • RQ3減衰ハイパーパrameterの手動チューニングを必要とせずに、EveはAdamや他の適応的最適化手法を凌駆できるか?
  • RQ4β3とcの異なるハイパーパラメータ設定において、Eveの性能はどれほど頑健か?
  • RQ5減衰強度のチューニングを必要とせずに、Eveは減衰戦略と同等またはそれ以上の性能を達成できるか?

主な発見

  • CIFAR-100画像分類タスクにおいて、EveはAdamやAdamaxを上回り、より高速な収束と低い最終損失を達成した。
  • bAbI-10k質問応答タスクにおいて、Eveは同じモデルアーキテクチャでAdamを上回る性能を示した。
  • Eveは指数的、1/t、1/√tの減衰スケジュールで得られる最良の性能に匹敵またはそれを上回ったが、減衰強度のチューニングを必要としなかった。
  • β3とcの異なるハイパーパラメータ設定においても、Eveは一貫してAdamを上回った。デフォルト値(β3=0.999、c=10)がほぼ最適な性能をもたらした。
  • Adamの性能は非最適な減衰強度に大きく依存する一方、Eveはすべてのテスト設定で安定的かつ優れた性能を維持した。
  • Eveは目的関数のフィードバックを用いてグローバル学習率を自動的に適応させるため、ハイパーパラメータチューニングの必要性を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。