Skip to main content
QUICK REVIEW

[论文解读] True Asymptotic Natural Gradient Optimization

Yann Ollivier|arXiv (Cornell University)|Dec 22, 2017
Stochastic Gradient Optimization Techniques参考文献 12被引用 7
一句话总结

该论文提出 TANGO,一种轻量级优化算法,无需显式计算或求逆 Fisher 信息矩阵,即可渐近收敛至精确的自然梯度下降。通过使用基于模型预测伪样本的类动量更新,TANGO 在学习率趋近于零的极限下隐式近似自然梯度流,实现参数化无关性,并在二次与非二次模型中均达到最优渐近收敛。

ABSTRACT

We introduce a simple algorithm, True Asymptotic Natural Gradient Optimization (TANGO), that converges to a true natural gradient descent in the limit of small learning rates, without explicit Fisher matrix estimation. For quadratic models the algorithm is also an instance of averaged stochastic gradient, where the parameter is a moving average of a "fast", constant-rate gradient descent. TANGO appears as a particular de-linearization of averaged SGD, and is sometimes quite different on non-quadratic models. This further connects averaged SGD and natural gradient, both of which are arguably optimal asymptotically. In large dimension, small learning rates will be required to approximate the natural gradient well. Still, this shows it is possible to get arbitrarily close to exact natural gradient descent with a lightweight algorithm.

研究动机与目标

  • 开发一种实用的优化算法,渐近实现自然梯度下降的性能,同时避免 Fisher 矩阵估计的计算开销。
  • 通过证明在二次情况下与平均随机梯度下降的等价性,以及在非二次情况下存在平滑插值,弥合二者之间的理论差距。
  • 提供一种方法,保持自然梯度的关键特性——参数化无关性,同时仅使用一阶梯度和简单更新。
  • 在弱正则性条件下,建立在学习率趋于零的极限下收敛至真实自然梯度轨迹的理论基础。

提出的方法

  • TANGO 使用一个速度变量 $v_k$,通过类动量递推方式更新,该方式结合了真实数据点和伪采样数据点的梯度。
  • 该算法生成伪输出 $\tilde{y}_k \sim p_\theta(\cdot|x_k)$,并计算梯度 $g_k = \partial \ell(y_k|x_k)/\partial\theta$ 和 $\tilde{g}_k = \partial \ell(\tilde{y}_k|x_k)/\partial\theta$。
  • 速度更新 $v_k = (1 - \delta t_{k-1})v_{k-1} + \gamma g_k - \gamma(1 - \delta t_{k-1})(v_{k-1}^\top \tilde{g}_k)\tilde{g}_k$ 通过随机近似隐式求逆 Fisher 矩阵。
  • 参数更新为 $\theta_k = \theta_{k-1} - \delta t_k v_k$,其中 $\delta t_k$ 为小的学习率,确保收敛至自然梯度方向。
  • 对于二次损失,TANGO 在数学上等价于特定噪声模型下的平均随机梯度下降,从而与已知最优方法建立联系。
  • 当 $\gamma$ 选择满足 $\gamma \leq \mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$ 时,算法保持稳定,更安全的选择基于经验矩估计。

实验结果

研究问题

  • RQ1能否设计一种简单、轻量级的算法,在不显式计算 Fisher 矩阵的前提下近似自然梯度下降?
  • RQ2在二次情况下,TANGO 与平均随机梯度下降有何关系?
  • RQ3当学习率趋于零时,TANGO 是否收敛至真实自然梯度轨迹?
  • RQ4伪采样在实现隐式 Fisher 矩阵求逆中起到什么作用?
  • RQ5TANGO 如何在避免显式 Hessian 或 Fisher 矩阵计算的前提下,保持对参数化的不变性?

主要发现

  • 当 $\delta t \to 0$ 且 $\gamma$ 固定时,TANGO 在极限下收敛至精确自然梯度轨迹,如定理 3 所证明。
  • 当 $\delta t = 1$ 时,TANGO 退化为学习率恒定的梯度下降 $\gamma$,表明其在标准与自然梯度下降之间实现插值。
  • 在二次情况下,TANGO 等价于平均随机梯度下降,其中 $\theta_k$ 是 $v_k$ 上快速梯度下降的移动平均。
  • TANGO 中的速度更新通过在 $v$ 上的随机梯度下降求解线性系统 $J v = \mathbb{E}[g]$,其中 $J = \mathbb{E}[\tilde{g} \tilde{g}^\top]$ 为 Fisher 矩阵。
  • TANGO 实现了对重参数化的不变性,这是自然梯度的关键特性,且无需显式计算 Fisher 矩阵。
  • 当 $\gamma$ 受 $\mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$ 限制时,理论稳定性得以保证,更安全的取值基于矩估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。