Skip to main content
QUICK REVIEW

[论文解读] Information Geometry of Orthogonal Initializations and Training

Piotr Sokół, Il Memming Park|arXiv (Cornell University)|Oct 9, 2018
Stochastic Gradient Optimization Techniques参考文献 40被引用 7
一句话总结

本文建立了优化景观的最大曲率(由费雪信息矩阵,FIM 所衡量)与深度神经网络中输入-输出雅可比矩阵谱半径之间的联系。研究发现,初始 FIM 曲率越小(与雅可比矩阵最大奇异值越小相关),训练速度越快且泛化性能越好;但出人意料的是,高度等距的网络(曲率最小)表现更差,原因在于训练过程中 FIM 特征值迅速增长。在训练全程保持正交性的流形优化方法,无论初始平滑性如何,其性能均优于标准欧几里得优化,表明梯度平滑性本身并不能解释训练速度优势。

ABSTRACT

Recently mean field theory has been successfully used to analyze properties of wide, random neural networks. It gave rise to a prescriptive theory for initializing feed-forward neural networks with orthogonal weights, which ensures that both the forward propagated activations and the backpropagated gradients are near $\ell_2$ isometries and as a consequence training is orders of magnitude faster. Despite strong empirical performance, the mechanisms by which critical initializations confer an advantage in the optimization of deep neural networks are poorly understood. Here we show a novel connection between the maximum curvature of the optimization landscape (gradient smoothness) as measured by the Fisher information matrix (FIM) and the spectral radius of the input-output Jacobian, which partially explains why more isometric networks can train much faster. Furthermore, given that orthogonal weights are necessary to ensure that gradient norms are approximately preserved at initialization, we experimentally investigate the benefits of maintaining orthogonality throughout training, from which we conclude that manifold optimization of weights performs well regardless of the smoothness of the gradients. Moreover, motivated by experimental results we show that a low condition number of the FIM is not predictive of faster learning.

研究动机与目标

  • 从信息几何的角度理解为何临界正交初始化能够加速深度网络的训练。
  • 研究费雪信息矩阵(FIM)在预测训练动态和泛化性能中的作用。
  • 检验在训练过程中保持正交性是否能超越初始梯度保持,从而提升优化性能。
  • 解决一个悖论:高度等距网络初始 FIM 曲率最小,但训练速度反而慢于中等等距网络。
  • 评估 FIM 条件数是否能预测更快的学习速度,从而挑战近期的假设。

提出的方法

  • 在高斯初始化和正交初始化下,推导出 FIM 最大特征值 λ_max(Ḡ) 与输入-输出雅可比矩阵最大平方奇异值 s_max² 之间关系的新界。
  • 利用该界分析雅可比谱与参数空间中局部梯度平滑性之间的关系。
  • 运用神经正切核(NTK)及其谱特性,解释训练发散动态,特别是最小 FIM 特征值的作用。
  • 比较欧几里得随机梯度下降与在 Stiefel 和 Oblique 流形上进行的黎曼优化在保持权重正交性方面的训练动态。
  • 分析训练过程中 FIM 特征值的演化,评估曲率变化对学习率和收敛性的影响。
  • 应用 Lee 等人 [19] 关于 NTK 差异的理论界,将 FIM 谱与泛化和训练稳定性联系起来。

实验结果

研究问题

  • RQ1在深度网络中,费雪信息矩阵的最大特征值如何与输入-输出雅可比矩阵的谱半径相关联?
  • RQ2为何高度等距网络在初始 FIM 曲率最小的情况下,训练速度反而更慢?
  • RQ3FIM 的条件数是否能预测深度神经网络中的更快学习或更好泛化?
  • RQ4在训练全程保持正交性的流形优化,是否能独立于初始梯度平滑性,提升优化速度?
  • RQ5根据 NTK 理论,FIM 的最小特征值在多大程度上决定了长期训练行为?

主要发现

  • 费雪信息矩阵的最大特征值 λ_max(Ḡ) 与输入-输出雅可比矩阵最大奇异值的平方 s_max² 成正比,为雅可比谱与优化曲率之间建立了直接联系。
  • 初始 FIM 曲率较小的网络(s_max 较小)训练更快且泛化性能更好,但最等距的网络(q* 最小)表现最差,原因在于训练过程中 λ_max(Ḡ) 迅速上升。
  • 高度等距网络性能悖论的根源在于线性化与完整训练动态的指数发散,其受最小 FIM 特征值 λ_min(Ḡ) 控制,而该值随 q* 减小而增大。
  • 流形正则化训练(Stiefel 和 Oblique 优化)对初始 FIM 曲率不敏感,即使在初始平滑性更优的欧几里得训练下,其损失下降速度也更快。
  • 流形优化的优势无法通过梯度平滑性(λ_max(Ḡ))的改善来解释,这与近期认为批归一化通过类似机制起作用的主张相矛盾。
  • FIM 的低条件数(λ_max/λ_min)不能预测更快学习,且有效优化需要一定程度的谱各向异性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。