Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study of Large-Batch Stochastic Gradient Descent with Structured Covariance Noise

Yeming Wen, Kevin Luk|arXiv (Cornell University)|Feb 21, 2019
Stochastic Gradient Optimization Techniques参考文献 65被引用数 12
ひとこと要約

本稿では、最適化速度を損なわずに一般化性能を向上させるために、大バッチ確率的勾配降下法(SGD)に構造的共分散ノイズ——特に対角フィッシャー・ノイズ——を導入することを提案する。ノイズの分散だけでなく構造を活用することで、大バッチ学習でも小バッチ学習と同等の一般化性能を達成し、実験的にも収束が速く、小バッチSGDと同等のテスト精度を示した。

ABSTRACT

The choice of batch-size in a stochastic optimization algorithm plays a substantial role for both optimization and generalization. Increasing the batch-size used typically improves optimization but degrades generalization. To address the problem of improving generalization while maintaining optimal convergence in large-batch training, we propose to add covariance noise to the gradients. We demonstrate that the learning performance of our method is more accurately captured by the structure of the covariance matrix of the noise rather than by the variance of gradients. Moreover, over the convex-quadratic, we prove in theory that it can be characterized by the Frobenius norm of the noise matrix. Our empirical studies with standard deep learning model-architectures and datasets shows that our method not only improves generalization performance in large-batch training, but furthermore, does so in a way where the optimization performance remains desirable and the training duration is not elongated.

研究の動機と目的

  • 大バッチSGD学習における一般化ギャップを解消すること——大バッチでは最適化は向上するが、一般化性能が劣化する。
  • 勾配更新におけるノイズ構造——分散のみでなく、その構造自体——が最適化挙動をより良く特徴づけるかを調査すること。
  • 高速な収束を維持しつつ、大バッチ設定での一般化性能を向上させるノイズ注入法を開発すること。
  • フル・フィッシャー法や等方的ノイズと比較して、対角フィッシャー・ノイズが一般化と最適化速度の間に良好なトレードオフを提供することを示すこと。
  • 非凸な深層学習設定におけるノイズ共分散構造と収束の理論的・実験的関係を確立すること。

提案手法

  • フィッシャー情報行列の対角から導出される共分散構造を持つ勾配ノイズを、大バッチSGD更新に組み込むことを提案する。
  • 対数尤度損失下でのフィッシャー情報行列を用い、小バッチと大バッチの勾配差をノイズとしてモデル化する。
  • 計算コストを削減し収束速度を向上させるために、フル・フィッシャー・ノイズを対角フィッシャー・ノイズに置き換える。
  • 理論的分析により、凸二次設定では収束がノイズ共分散行列のフロベニウスノルムによって特徴づけられることを示す。
  • 固定された学習エポック数で、標準的な深層学習モデル(例:CIFAR-10におけるResNet44)を用いて実験的に検証する。
  • ベースライン手法との比較:小バッチSGD、大バッチSGD、等方的ノイズを用いた大バッチSGD、フル・フィッシャー・ノイズを用いた大バッチSGD。

実験結果

リサーチクエスチョン

  • RQ1特定の共分散行列を持つ構造的ノイズが、最適化速度を損なわず大バッチSGDの一般化性能を向上させられるか?
  • RQ2勾配の分散のみで最適化挙動を予測できるのか、それともノイズ構造がより重要な役割を果たすのか?
  • RQ3ノイズ共分散の選択——特に対角フィッシャーとフル・フィッシャーの比較——が、大バッチ学習における収束と一般化に与える影響は何か?
  • RQ4対角フィッシャー・ノイズは、大バッチ学習の効率を保ちながら、小バッチSGDと同等の一般化性能を再現できるか?
  • RQ5非凸な深層学習問題において、ノイズ共分散構造と収束の理論的関係は何か?

主な発見

  • 対角フィッシャー・ノイズを用いた大バッチSGDは、同じ学習エポック数内で小バッチSGDと同等の一般化性能を達成した。
  • 高い勾配分散を持つにもかかわらず、対角フィッシャー・ノイズを用いた大バッチ学習は、フル・フィッシャー・ノイズを用いた場合よりも著しく収束が速かった。
  • フル・フィッシャー・ノイズは極めて収束が遅く、8000回のパラメータ更新後でさえ実用的でないほどだった。
  • 理論的分析により、凸二次設定では収束がノイズ共分散行列のフロベニウスノルムによって特徴づけられることを示した。
  • 実験的結果から、非凸な深層学習設定でもノイズ行列のフロベニウスノルムが最適化挙動の強力な予測子であることが確認された。
  • 対角フィッシャー・ノイズは、等方的ガウス・ノイズやフル・フィッシャー・ノイズと比較して、一般化と収束速度のバランスにおいて優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。