Skip to main content
QUICK REVIEW

[論文レビュー] True Asymptotic Natural Gradient Optimization

Yann Ollivier|arXiv (Cornell University)|Dec 22, 2017
Stochastic Gradient Optimization Techniques参考文献 12被引用数 7
ひとこと要約

本稿では、フィッシャー情報行列の明示的計算や逆行列計算を伴わずに、漸近的に正確な自然勾配降下に収束する軽量な最適化アルゴリズム、TANGOを提案する。小さな学習率の極限において、モデルの予測から得られる擬似サンプルを用いたモーメンタム型更新により、自然勾配フローを暗黙的に近似する。この手法により、パrameterizationに不変であり、二次的および非二次的モデルの両方で最適な漸近的収束性を達成する。

ABSTRACT

We introduce a simple algorithm, True Asymptotic Natural Gradient Optimization (TANGO), that converges to a true natural gradient descent in the limit of small learning rates, without explicit Fisher matrix estimation. For quadratic models the algorithm is also an instance of averaged stochastic gradient, where the parameter is a moving average of a "fast", constant-rate gradient descent. TANGO appears as a particular de-linearization of averaged SGD, and is sometimes quite different on non-quadratic models. This further connects averaged SGD and natural gradient, both of which are arguably optimal asymptotically. In large dimension, small learning rates will be required to approximate the natural gradient well. Still, this shows it is possible to get arbitrarily close to exact natural gradient descent with a lightweight algorithm.

研究の動機と目的

  • フィッシャー行列推定の計算コストを伴わず、自然勾配降下の性能に漸近的に到達する実用的な最適化アルゴリズムの開発。
  • 平均化された確率的勾配降下と自然勾配降下の理論的ギャップを埋めるために、二次的な場合に両者の等価性を示し、非二次的な場合に滑らかな補間を示す。
  • 一次勾配と単純な更新式のみを用いて、自然勾配が持つ重要な性質であるパrameterizationに不変である性質を維持する方法の提供。
  • 緩い正則性条件の下で、学習率がゼロに近づく極限において、真の自然勾配軌道への理論的収束を確立する。

提案手法

  • TANGOは、実データ点および擬似サンプルからの勾配を組み込んだモーメンタム型の再帰的更新を用いる速度変数 $v_k$ を使用する。
  • 擬似出力 $\tilde{y}_k \sim p_\theta(\cdot|x_k)$ を生成し、勾配 $g_k = \partial \ell(y_k|x_k)/\partial\theta$ および $\tilde{g}_k = \partial \ell(\tilde{y}_k|x_k)/\partial\theta$ を計算する。
  • 速度更新 $v_k = (1 - \delta t_{k-1})v_{k-1} + \gamma g_k - \gamma(1 - \delta t_{k-1})(v_{k-1}^\top \tilde{g}_k)\tilde{g}_k$ は、確率的近似を通じてフィッシャー行列を暗黙的に逆行列化する。
  • パrameter更新は $\theta_k = \theta_{k-1} - \delta t_k v_k$ であり、$\delta t_k$ は小さな学習率であるため、自然勾配方向への収束が保証される。
  • 二次損失の場合、TANGOは特定のノイズモデルを持つ平均化された確率的勾配降下と数学的に同等であり、既知の最適手法と関連づけられる。
  • 安全な選択肢は、経験的モーメント推定に基づき、$\gamma \leq \mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$ を満たすように $\gamma $ を選ぶことで、安定性が保証される。

実験結果

リサーチクエスチョン

  • RQ1明示的なフィッシャー行列計算を伴わず、フィッシャー行列を暗黙的に逆行列化する単純で軽量なアルゴリズムは、自然勾配降下を近似可能か?
  • RQ2二次的な場合に、TANGOは平均化された確率的勾配降下とどのように関係するか?
  • RQ3学習率がゼロに近づく極限において、TANGOは真の自然勾配軌道に収束するか?
  • RQ4擬似サンプリングは、暗黙的なフィッシャー行列逆行列化を可能にする役割を果たすか?
  • RQ5TANGOは、ヘッセ行列やフィッシャー行列の明示的計算を避けても、パrameterizationに不変である性質をどのように維持するか?

主な発見

  • 定理3で示されるように、$\gamma$ を固定したまま学習率 $\delta t \to 0$ の極限において、TANGOは正確な自然勾配軌道に収束する。
  • $\delta t = 1$ の場合、TANGOは定数学習率 $\gamma$ の標準的勾配降下に帰着するため、標準的勾配降下と自然勾配降下の間を補間する性質を持つことが示された。
  • 二次的な場合、TANGOは平均化された確率的勾配降下と同等であり、$\theta_k$ は $v_k$ に対する高速勾配降下の移動平均として表現できる。
  • TANGOの速度更新は、$J = \mathbb{E}[\tilde{g} \tilde{g}^\top]$ がフィッシャー行列である線形方程式 $J v = \mathbb{E}[g]$ を、$v$ に対する確率的勾配降下で解く。
  • TANGOは、明示的なフィッシャー行列計算を伴わず、自然勾配が持つ重要な性質であるパrameterizationに不変である性質を達成する。
  • 理論的安定性は、$\gamma \leq \mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$ を満たすように $\gamma $ を選ぶことで保証され、より安全な選択は経験的モーメント推定に基づく。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。