Skip to main content
QUICK REVIEW

[論文レビュー] A Study of Gradient Variance in Deep Learning

Fartash Faghri, David Duvenaud|arXiv (Cornell University)|Jul 9, 2020
Domain Adaptation and Few-Shot Learning参考文献 42被引用数 13
ひとこと要約

本稿は深層学習における勾配の分散に関する調査を行い、勾配空間内の重み付きクラスタからのサンプリングによって分散を最小化するための勾配クラスタリング(GC)を提案する。訓練の過程で勾配分散が増加することを発見し、これは一般的な仮定とは対照的である。また、収束速度の予測子として、標準の分散よりも優れた指標である正規化勾配分散を導入し、データに重複がある場合にGCが分散を顕著に低減することを示している。

ABSTRACT

The impact of gradient noise on training deep models is widely acknowledged but not well understood. In this context, we study the distribution of gradients during training. We introduce a method, Gradient Clustering, to minimize the variance of average mini-batch gradient with stratified sampling. We prove that the variance of average mini-batch gradient is minimized if the elements are sampled from a weighted clustering in the gradient space. We measure the gradient variance on common deep learning benchmarks and observe that, contrary to common assumptions, gradient variance increases during training, and smaller learning rates coincide with higher variance. In addition, we introduce normalized gradient variance as a statistic that better correlates with the speed of convergence compared to gradient variance.

研究の動機と目的

  • 深層学習の訓練過程における勾配の分布、特にその構造と最適化に与える影響を理解すること。
  • 学習率、バッチサイズ、モデルアーキテクチャ、データ分布などの要因が勾配分散に与える影響を調査すること。
  • パラメータ空間における勾配のクラスタリングを活用して、ミニバッチ勾配推定の分散を低減する手法を開発すること。
  • 勾配分散およびその正規化形が、標準の分散よりも訓練速度や一般化性能とどれほど相関しているかを評価すること。
  • 学習率を低下させた直後に損失が低下するという直感に反する現象や、深層ネットワークにおけるSVRGの失敗を説明すること。

提案手法

  • 勾配空間における勾配のクラスタリングと、重み付きクラスタからのサンプリングにより、平均ミニバッチ勾配の分散を最小化する勾配クラスタリング(GC)を提案する。
  • 理論的に、平均ミニバッチ勾配の分散が、勾配空間における重み付きクラスタからのサンプリングがなされた場合に最小化されることを証明する。
  • 収束速度との相関が標準の勾配分散よりも優れているため、収束速度の予測子としてより優れた統計量である正規化勾配分散を導入する。
  • 勾配クラスタリングに基づく層別サンプリングを採用し、勾配推定の安定性を向上させ、分散を低減する。
  • 実ベンチマーク(MNIST、CIFAR-10、ImageNet)および合成されたランダム特徴量モデルを用いて、分散のダイナミクスを測定する。
  • 重複するデータポイントを含む制御された実験を実施し、データの重複下でのGCの分散低減効果をテストする。

実験結果

リサーチクエスチョン

  • RQ1深層学習における勾配分布は、クラスタリングのような構造的モードを示すか?
  • RQ2勾配分散は訓練の過程でどのように変化するのか?また、学習率やバッチサイズに依存するか?
  • RQ3勾配空間におけるクラスタリングを活用することで、標準的なサンプリングに比べてミニバッチ勾配推定の分散をより効果的に低減できるか?
  • RQ4正規化勾配分散は、標準の勾配分散よりも収束速度とより強く相関しているか?
  • RQ5学習率を低下させた直後に損失が低下するのはなぜか?また、勾配ノイズはこの現象とどのように関係するか?

主な発見

  • 勾配分散は訓練の過程で増加しており、これは一般的に仮定されている「時間とともに減少する」という仮定とは対照的である。
  • 小さな学習率は高い勾配分散と関連しており、最適化の安定性において直感に反するトレードオフを示唆している。
  • 正規化勾配分散は標準の勾配分散よりも収束速度とより強く相関しており、収束速度の診断ツールとして優れている。
  • データに重複がある場合、勾配クラスタリング(GC)は勾配分散を顕著に低減する。特に過パラメータ化された状況で顕著である。
  • GCは、やや過パラメータ化された状況ではダブルバッチSGD(SG-2B)と同等の性能を示すが、標準的なSGD(SG-B)に比べて分散低減において優れている。
  • SVRGが深層学習で失敗する理由は、過パラメータ化された状況における内在的ノイズ分散が低いことが主な要因であり、制御変数の陳腐化(staleness)によるものではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。