Skip to main content
QUICK REVIEW

[論文レビュー] kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks

Tao Zhang, Wei Li|arXiv (Cornell University)|Apr 13, 2020
Machine Learning and Data Classification被引用数 4
ひとこと要約

本稿では、学習率(LR)関数のk階微分を用いてLRスケジュールを変更することで、深層ニューラルネットワークの学習を改善するシンプルかつ効果的な手法k-decayを提案する。k-decay項を追加することで、特に学習後期においてLRの変化率を高めることで、追加の計算コストを伴わずにモデルの精度を向上させ、CIFAR-100では最大2.07%、ImageNetでは1.25%の精度向上を達成する。

ABSTRACT

Recent work has shown that optimizing the Learning Rate (LR) schedule can be a very accurate and efficient way to train deep neural networks. We observe that the rate of change (ROC) of LR has correlation with the training process, but how to use this relationship to control the training to achieve the purpose of improving accuracy? We propose a new method, k-decay, just add an extra item to the commonly used and easy LR schedule(exp, cosine and polynomial), is effectively improves the performance of these schedule, also better than the state-of-the-art algorithms of LR shcedule such as SGDR, CLR and AutoLRS. In the k-decay, by adjusting the hyper-parameter \(k\), to generate different LR schedule, when k increases, the performance is improved. We evaluate the k-decay method on CIFAR And ImageNet datasets with different neural networks (ResNet, Wide ResNet). Our experiments show that this method can improve on most of them. The accuracy has been improved by 1.08\% on the CIFAR-10 dataset and by 2.07 \% on the CIFAR-100 dataset. On the ImageNet, accuracy is improved by 1.25\%. Our method is not only a general method to be applied other LR Shcedule, but also has no additional computational cost.

研究の動機と目的

  • 標準的な減衰法を超えて、学習率(LR)スケジュールを再考することで、深層ニューラルネットワークの性能を向上させること。
  • LRの変化率(ROC)が学習ダイナミクスおよびモデル精度に与える相関関係を調査すること。
  • 既存のLRスケジュールを変更せずに、ハイパーパrameterの複雑さを増さない一般化可能で低コストな手法を開発すること。
  • 高階微分によるLRのROC制御が、さまざまなデータセットおよびアーキテクチャにおいて一貫した性能向上をもたらすことを示すこと。

提案手法

  • 本手法は、基本となるLRスケジュール関数η(t)のk階微分にk-decay項を導入し、η^(k)(t)に増分Δf^(k)(t)を加えることで実現される。
  • 修正されたk階微分方程式を解くことで、新しいLRスケジュールη'(t) = η_o(k,t)が導出され、これはハイパーパrameter kに依存する。
  • 多項式、コサイン、指数減衰といった標準的なLRスケジュールに、この手法を追加項として適用することで、構造の根幹を変えることなく性能を向上させる。
  • ハイパーパrameter kはLRのROCを制御する:kを増加させることで、学習後期におけるLRの変化率が上昇し、収束が最終段階で加速される。
  • 本手法は微分積分学に強く根ざしており、修正されたk階微分の解析的積分によりk-decay項が導出される。
  • 計算効率が高く、前方伝搬や逆伝搬の追加が不要であるため、任意の既存のLRスケジュールに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1学習率の変化率(ROC)は、特に学習後期においてモデルの学習性能とどのように相関するか?
  • RQ2高階微分による学習率のROC向上が、さまざまなデータセットおよびアーキテクチャにおいて一貫した精度向上をもたらすか?
  • RQ3ハイパーパrameter kはk-decay手法の性能にどのように影響を及ぼすか?また、異なるモデルにおける最適な範囲は何か?
  • RQ4k-decayは、多項式、コサイン、指数といった既存のLRスケジュールに一般化可能か?計算コストは増加しないか?
  • RQ5k-decayは、SGDR、CLR、AutoLRSといった最先端の適応的LRスケジューリング手法を、精度および学習安定性の面で上回るか?

主な発見

  • ResNet-50を用いたImageNetでは、k-decayが1.25%のトップ-1精度向上を達成し、SGDR、AutoLRS、CLRをそれぞれ1.03%、0.96%、0.95%上回った。
  • CIFAR-100では、k-decayがベースの多項式スケジュールに対して2.07%の精度向上を達成し、k=2.0のときトップ-1誤差率は23.11%となった。
  • CIFAR-10では、k-decayがベースの多項式スケジュールに対して1.08%の精度向上を示し、データセット全体にわたる一貫した向上が確認された。
  • k値が上昇するに従い、テスト誤差率は閾値k_vまで低下するが、それ以上になると性能が劣化する傾向にあり、モデル固有のkへの感受性が示された。
  • 深層モデル(例:ResNet-101)は浅層モデル(例:ResNet-47)と比較して、k_vの閾値が低く(3)、高k値に対して感受性が高くなる傾向を示した。
  • 損失曲線から、k値が高いほど初期段階では収束が遅くなるが、最終段階でのLRの急激な減少により、最終的な収束が速くなり、より低い最終損失と優れた一般化性能が得られることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。