Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Gradient Estimate Variance in Contrastive Divergence and Persistent Contrastive Divergence

Mathias Berglund, Tapani Raiko|arXiv (Cornell University)|Dec 20, 2013
Stochastic Gradient Optimization Techniques参考文献 14被引用数 3
ひとこと要約

本稿は、制限ボルツマンマシンの学習に用いる対照的分散(CD)および恒常的対照的分散(PCD)における確率的勾配推定の分散を、実験的に調査している。CD-1は正確なサンプリングよりも著しく低い勾配推定分散を示す一方、PCDは相関のあるサンプリングのため、以降の推定の平均における分散が著しく高くなることが判明し、これがPCDが通常CDよりも小さな学習率またはより大きなミニバッチを必要とする理由を説明している。

ABSTRACT

Contrastive Divergence (CD) and Persistent Contrastive Divergence (PCD) are popular methods for training the weights of Restricted Boltzmann Machines. However, both methods use an approximate method for sampling from the model distribution. As a side effect, these approximations yield significantly different biases and variances for stochastic gradient estimates of individual data points. It is well known that CD yields a biased gradient estimate. In this paper we however show empirically that CD has a lower stochastic gradient estimate variance than exact sampling, while the mean of subsequent PCD estimates has a higher variance than exact sampling. The results give one explanation to the finding that CD can be used with smaller minibatches or higher learning rates than PCD.

研究の動機と目的

  • CDおよびPCDにおける確率的勾配推定の分散を調査し、学習速度やハイパーパrameter選択に与える影響を明らかにすること。
  • CDが低分散を示すとされる理由が、近似サンプリングに起因するのか、それともデータ分布に近いからなのかを特定すること。
  • PCDにおける更新の相関が勾配推定分散に与える影響、特に学習後期における影響を分析すること。
  • 複数のデータセットおよび学習段階において、CD、PCD、正確なサンプリングの勾配分散を比較すること。
  • CDとPCDにおける学習率要件の差異を、勾配推定分散の観点から実証的根拠を提示すること。

提案手法

  • バイナリ化MNIST、CIFAR-10の中央パッチ、Caltech 101シルエットの3つのデータセットでRBMsを学習した。
  • CD-k(k=1から10)、PCD、CD-1000(正確なサンプリングの近似)、および独立CD(I-CD)を用いて勾配推定分散を評価した。
  • 10回のランダムな重み初期化と、1データポイントあたり10回の勾配サンプルに対して、重み行列の各要素の分散を測定した。
  • 可視ユニットおよび隠れユニットの数を固定し、バイアスはゼロに、重みは小さなランダム値に初期化した。
  • 10エポックおよび500エポックでの勾配推定の分散を計算し、学習過程における変化を評価した。
  • PCDとCD-1000を比較するため、連続するk個の推定の平均の分散比を計算した。

実験結果

リサーチクエスチョン

  • RQ1CDは正確なサンプリングよりも低い確率的勾配推定分散を示すか? もしそうなら、その理由は何か?
  • RQ2PCDの勾配推定分散は独立サンプリングと比べてどうか? また、学習が進むにつれて増加するか?
  • RQ3CDの低分散特性は、正の粒子からのサンプリングに起因するのか、それともサンプリングステップ数の制限に起因するのか?
  • RQ4PCDの更新の相関が、平均勾配推定の分散をどの程度増大させるか?
  • RQ5CDとPCDにおける学習率要件の差異は、勾配推定分散によって説明可能か?

主な発見

  • CD-1の勾配推定は、正確なサンプリングよりも著しく低い分散を示し、CDステップ数を増やしても分散はわずかに増加するにとどまる。
  • CDが正確なサンプリングよりも低分散を示す主な理由は、正の粒子から負の粒子をサンプリングしていることに起因し、ステップ数の制限によるものではない。
  • 独立CD(I-CD)では低分散特性が失われており、正の粒子に近いサンプリングがCDの低分散の鍵であることが示された。
  • 連続するPCD勾配推定の平均は、独立サンプリングと比べて著しく高い分散を示し、特に学習後期に顕著である。
  • CD-1では、10個の連続推定の平均の分散はPCDの複数倍も低く、PCDが小さな学習率またはより大きなミニバッチを必要とする理由が裏付けられた。
  • 結果は、CDの高速収束が部分的に低勾配分散に起因すること、PCDの高分散がその小さな学習率要件を説明していることを実証的に確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。