Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Gradient Descent with Hyperbolic-Tangent Decay on Classification

Bo Yang Hsueh, Wei Li|arXiv (Cornell University)|Jun 5, 2018
Advanced Neural Network Applications参考文献 23被引用数 4
ひとこと要約

本稿では、確率的勾配降下法(SGD)のための新しい学習率スケジューラーである双曲正接減衰(HTD)を提案する。HTDは、学習の進行に伴い学習率を動的に調整するための双曲正接関数を用いる。HTDは、ResNet、ワイドResNet、DenseNet、LSTMを含む複数のベンチマークでステップ減衰とコサインスケジューリングを上回る性能を示す。ステップ減衰より少ないハイパーパrameterを必要とし、コサインスケジューリングより高い柔軟性を提供する。HTD(-6,3)は、堅牢なデフォルト設定としての適性を示している。

ABSTRACT

Learning rate scheduler has been a critical issue in the deep neural network training. Several schedulers and methods have been proposed, including step decay scheduler, adaptive method, cosine scheduler and cyclical scheduler. This paper proposes a new scheduling method, named hyperbolic-tangent decay (HTD). We run experiments on several benchmarks such as: ResNet, Wide ResNet and DenseNet for CIFAR-10 and CIFAR-100 datasets, LSTM for PAMAP2 dataset, ResNet on ImageNet and Fashion-MNIST datasets. In our experiments, HTD outperforms step decay and cosine scheduler in nearly all cases, while requiring less hyperparameters than step decay, and more flexible than cosine scheduler. Code is available at https://github.com/BIGBALLON/HTD.

研究の動機と目的

  • 深層学習におけるSGDの既存の学習率スケジューラーに見られるハイパーパrameter感受性と最適でない性能の課題に対処すること。
  • ステップ減衰の性能的利点と適応的メソッドの柔軟性を組み合わせつつ、調整可能なパラメータ数を減らす学習率スケジューラーを開発すること。
  • 双曲正接関数に基づく新しいスケジューラーの多様なアーキテクチャとデータセットにおける有効性を評価すること。
  • さまざまな学習シナリオに一般化しやすい、堅牢でデフォルトとしての適性を持つスケジューラーの設定を特定すること。

提案手法

  • 提案されるHTDスケジューラーは、学習エポックに伴う学習率の減衰を双曲正接関数でモデル化し、$\alpha_t = \frac{L - U}{2} \cdot \tanh\left(\frac{t}{R}\right) + \frac{L + U}{2}$ で定義される。ここで$L$と$U$は学習率の下限と上限であり、$R$は減衰比を制御する。
  • 学習の初期では学習率が$U$に近く、学習が進むにつれて$\alpha_t$は$\alpha_t \to L$に漸近的に近づくため、滑らかで徐々に減衰する。
  • コサイン減衰(最小・最大率の調整のみ可能)より柔軟性が高く、ステップ減衰(複数の段階境界が必要)よりパラメータが少ない。
  • 標準的な深層学習ベンチマーク(CIFAR-10、CIFAR-100、ImageNet、PAMAP2、Fashion-MNIST)を用いて評価し、モデルにはResNet、ワイドResNet、DenseNet、BLSTMを用いる。
  • ハイパーパramータ感受性を評価するため、$L$、$U$、$R$を異なるデータセットと学習エポック数で変化させ、スケジューラーの堅牢性と一般化性能を分析する。

実験結果

リサーチクエスチョン

  • RQ1双曲正接関数に基づく学習率スケジューラーは、ステップ減衰やコサイン減衰といった既存のスケジューラーと比較して、最終的なモデル精度で優れているか?
  • RQ2HTDはステップ減衰より少ないハイパーパramータを必要としながら、性能を維持または向上させられるか?
  • RQ3HTDの柔軟性は、特に調整可能なパラメータ数と最終精度の観点から、コサインスケジューリングと比較してどうか?
  • RQ4異なるデータセットとモデルアーキテクチャにおいて、HTDハイパーパラメータ(例:$L$、$U$、$R$)の最適な設定は何か?
  • RQ5HTDの性能は学習期間に大きく依存するか? また、一度の設定でさまざまな学習スケジュールに一般化可能か?

主な発見

  • HTD(-6,3)は、全評価実験でステップ減衰を上回り、ResNet-18を用いたImageNetではトップ-1誤差率が0.58%低く、ResNet-34では0.48%低い。
  • CIFAR-100では、DenseNet-BC-100-12およびDenseNet-BC-250-24の両方で、コサインスケジューラーと比較してHTD(-6,3)が0.42%高い精度を達成した。
  • CIFAR-100のWRN-28-10では、コサインスケジューラーと比較してHTD(-6,3)が0.81%の改善を示した。
  • PAMAP2では、ステップ減衰と比較してHTD(-6,3)が0.16%低い誤差率、コサインスケジューラーと比較して0.22%低い誤差率を達成した。
  • Fashion-MNISTでは、ステップ減衰と比較してHTD(-6,3)が0.15%高い性能、コサインスケジューラーと比較して0.06%高い性能を示した。
  • 最適な比$R$はデータセットに依存する:CIFAR-10では200エポックで$R=5$、400エポックで$R=2$が最適であり、CIFAR-100では両設定で$R=10$が最適であった。これは、データセット依存の感受性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。