[論文レビュー] Stochastic natural gradient descent draws posterior samples in function space
この論文は、モデルの予測が真の条件付き分布に近づく場合、ミニバッチ自然勾配降下法(NGD)が関数空間におけるベイズ的事後分布から漸近的にサンプリングすることを証明している。温度は $ T \approx \epsilon N / (2B) $ である。また、パラメータライゼーション依存性を補正するためジェフリー ス・プライアを組み込んだ、新たな最適化手法である確率的NGD(stochastic NGD)を導入し、パラメータ空間全体で有効な事後分布サンプリングを可能にしている。
Recent work has argued that stochastic gradient descent can approximate the Bayesian uncertainty in model parameters near local minima. In this work we develop a similar correspondence for minibatch natural gradient descent (NGD). We prove that for sufficiently small learning rates, if the model predictions on the training set approach the true conditional distribution of labels given inputs, the stationary distribution of minibatch NGD approaches a Bayesian posterior near local minima. The temperature $T = \\epsilon N / (2B)$ is controlled by the learning rate $\\epsilon$, training set size $N$ and batch size $B$. However minibatch NGD is not parameterisation invariant and it does not sample a valid posterior away from local minima. We therefore propose a novel optimiser, "stochastic NGD", which introduces the additional correction terms required to preserve both properties.
研究の動機と目的
- ミニバッチ自然勾配降下法と関数空間におけるベイズ的事後分布サンプリングとの間の理論的対応関係を確立すること。
- NGDの定常分布が局所最小値付近でベイズ的事後分布に近似する条件を同定すること。
- 標準的なミニバッチNGDに見られるパラメータライゼーション不変性の欠如を解消するため、補正された更新ルールを導出すること。
- パラメータライゼーション不変性と有効な事後分布サンプリングの両方を保持する新しい最適化手法、確率的NGD(SNGD)を提案・検証すること。
- NGDにおける最適な一般化性能が $ B \approx \epsilon N / 2 $ で発現することを実験的に検証すること。これはベイズ的予測と整合的である。
提案手法
- \epsilon \to 0 の極限において、ミニバッチNGDの定常分布を導出し、モデルの予測が真の条件付き分布に近づく場合、温度 $ T = \epsilon N / (2B) $ でベイズ的事後分布に収束することを示した。
- 標準的なミニバッチNGDは、フィッシャー情報行列のパラメータ依存性により、パラメータライゼーション不変性を欠いていることが同定された。
- パラメータライゼーション不変性を回復するために、フィッシャー情報行列の微分から導かれる補正項を追加した、確率的NGD(SNGD)を提案した。
- 乗法的バイアス項を導入し、これはジェフリー ス・プライアに相当し、パラメータ空間全体で定常分布が有効な事後分布のままであることを保証した。
- 訓練中の分散を低減するために、フィッシャー情報行列の移動平均と適応的スムージングを用いた。
- 最終的な勾配更新のアンサンブルを用いて、事後予測分布を推定し、一般化性能を評価した。
実験結果
リサーチクエスチョン
- RQ1ミニバッチNGDが関数空間におけるベイズ的事後分布から漸近的にサンプリングするのはどのような条件下か?
- RQ2温度 $ T \approx \epsilon N / (2B) $ がNGDの定常分布をどのように制御するか?
- RQ3なぜ標準的なミニバッチNGDはパラメータライゼーション不変性を満たさないのか? そして、その欠如をどのように是正できるか?
- RQ4修正されたNGD更新ルールは、確率的勾配を用いても、パラメータライゼーション不変性と有効な事後分布サンプリングの両方を保持できるか?
- RQ5NGDの最適なバッチサイズが、$ B \approx \epsilon N / 2 $ で予測されるベイズ的予測と一致するか?
主な発見
- f_{\omega}(x_i) \to P(Y|x_i) のとき、ミニバッチNGDの定常分布は、局所最小値付近で温度 $ T \approx \epsilon N / (2B) $ のベイズ的事後分布に近づく。
- 実験的結果から、NGDアンサンブルのテストクロスエントロピーは $ B \approx \epsilon N / 2 $ のときに最小化され、理論的予測と一致した。
- N=4096 の場合、テストクロスエントロピーの最小値は B=256 で発生し、これはベイズ的予測の $ B \propto N $ と一致する。
- N を 16384 に増加させると、テストクロスエントロピーの最小値はより平坦になり、理論的予測と整合的である。
- MNIST におけるCNN実験では、温度 T を一定に保った場合、テストクロスエントロピーは学習率にほとんど依存せず、線形スケーリング則 $ B \propto \epsilon $ が確認された。
- T \gtrsim 1 になると、テストクロスエントロピーが急激に上昇し、一般化性能が劣化することが示され、これはベイズ理論と整合的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。