Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Variational Optimization

Thomas Bird, Julius Kunze|arXiv (Cornell University)|Sep 13, 2018
Metaheuristic Optimization Algorithms Research参考文献 9被引用数 15
ひとこと要約

この論文は、微分不能または離散的目的関数のための微分可能上界として、確率的変分最適化(SVO)を導入し、ガウスノイズを用いたガウス摂動(GP)や自然進化的戦略(NES)が、ガウスサンプリングを用いたSVOの特殊ケースであることを示している。微分可能な目的関数では、確率的方向微分(SDD)が顕著に低い分散を示すため、並列的な確率的勾配降下法においてSVOに基づく手法よりも優れていることが示された。

ABSTRACT

Variational Optimization forms a differentiable upper bound on an objective. We show that approaches such as Natural Evolution Strategies and Gaussian Perturbation, are special cases of Variational Optimization in which the expectations are approximated by Gaussian sampling. These approaches are of particular interest because they are parallelizable. We calculate the approximate bias and variance of the corresponding gradient estimators and demonstrate that using antithetic sampling or a baseline is crucial to mitigate their problems. We contrast these methods with an alternative parallelizable method, namely Directional Derivatives. We conclude that, for differentiable objectives, using Directional Derivatives is preferable to using Variational Optimization to perform parallel Stochastic Gradient Descent.

研究の動機と目的

  • 非微分可能または離散的目的関数の最適化のための、原理的で微分可能な上界としてのSVOを形式化すること。
  • ガウス摂動(GP)勾配推定器のバイアスと分散を分析し、高い分散が分散低減なしでは実用的でないことを示すこと。
  • アンチシメトリックサンプリングとベースライン手法がGP推定器の分散低減に果たす役割を評価し、訓練の安定化に不可欠であることを示すこと。
  • SVOに基づく手法と、方向微分(DD)に基づく代替可能な並列勾配推定器を比較し、特に微分可能な目的関数に対して検討すること。
  • 微分可能な目的関数では、ノイズスケールのハイパーパramータチューニングが不要で、分散が低いことから、DDがSVOよりも優れていることを確立すること。

提案手法

  • SVOを、$ U(\theta) = \mathbb{E}_{p(x|\theta)}[f(x)] $ という上界の最小化として定式化し、$ \theta $ が変分分布 $ p(x|\theta) $ をパrameter化するようにし、微分可能な最適化を可能にする。
  • モンテカルロサンプリングを用いて $ U(\theta) $ の勾配を近似し、$ \nabla_\theta U \approx \frac{1}{S} \sum_{s=1}^S f(x^s) \nabla_\theta \log p(x^s|\theta) $ を得る。ここで $ x^s \sim p(x|\theta) $ である。
  • 変分分布をガウス分布に特化することでSVOをガウス摂動に適用し、$ p(x|\theta) = \mathcal{N}(\mu, \sigma^2 I) $ とすることで、GP推定器 $ \nabla_\mu U = \frac{1}{\sigma^2} \mathbb{E}_\epsilon [\epsilon f(\mu + \epsilon)] $ を得る。
  • アンチシメトリックサンプリングを導入し、$ \epsilon $ と $ -\epsilon $ をペairで組ませることでGP推定器の分散を低減し、その分散低減の近似式を導出する。
  • 移動平均ベースラインを用いてGP推定器の分散をさらに低減し、アンチシメトリックサンプリングと同等の性能を達成することを示す。
  • 代替の勾配推定器として、確率的方向微分(DD)推定器を提案・分析し、ノイズスケールのハイパーパramータの必要性を回避する。

実験結果

リサーチクエスチョン

  • RQ1確率的変分最適化(SVO)は、ガウス摂動や自然進化的戦略(NES)といった既存の進化的および勾配近似手法とどのように関係しているか?
  • RQ2ガウス摂動(GP)勾配推定器のバイアスと分散構造は何か?アンチシメトリックサンプリングとベースラインはそれらにどのように影響するか?
  • RQ3アンチシメトリックサンプリングを用いたGP推定器の性能は、SPSA勾配推定器と比較してどうか?
  • RQ4微分可能な目的関数に対して、SVOに基づく手法を上回る分散と安定性を示す並列可能勾配推定器は存在するか?
  • RQ5確率的方向微分(DD)は、ガウス摂動に基づくSVOの代替として、ハイパーパramータなしで低分散を実現できるか?

主な発見

  • ガウス摂動(GP)推定器は、変分分布がガウス分布の場合のSVOの特殊ケースであり、アンチシメトリックサンプリングやベースラインによる補正がなければ、高い分散に苦しむ。
  • アンチシメトリックサンプリングは、バイアスに影響を与えずにGP推定器の分散を顕著に低減し、導出された解析的式でその分散低減が良好に近似される。
  • GP推定器にベースラインを適用することで、アンチシメトリックサンプリングと同等の分散低減が達成され、適切にチューニングされた場合には実用的になる。
  • アンチシメトリックサンプリングを用いたGP推定器は、SPSA勾配推定器と類似したバイアスと分散特性を示し、密接な関係にある。
  • 微分可能な目的関数では、確率的方向微分(DD)推定器の分散は標準的なGPに比べて顕著に低く、合成的およびニューラルネットワークの実験において、アンチシメトリックサンプリングを用いたGPを上回る性能を示した。
  • MNISTの3層全結合ネットワークの学習において、DD法はアンチシメトリックサンプリングなしのGPよりも優れた収束性と低い損失を達成し、アンチシメトリックサンプリング付きGPと同等またはそれを上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。