Skip to main content
QUICK REVIEW

[论文解读] Implicit Regularization and Convergence for Weight Normalization

Xiaoxia Wu, Edgar Dobriban|arXiv (Cornell University)|Nov 18, 2019
Sparse and Compressive Sensing Techniques参考文献 69被引用 5
一句话总结

本文研究了在过参数化最小二乘回归中,权重归一化(WN)及其变体——重参数化投影梯度下降(rPGD)的隐式正则化行为,表明无论初始值如何,它们均会收敛至接近最小 $̂²$ 范数解的解。与仅在零初始化时才能实现此效果的标准梯度下降不同,WN 和 rPGD 由于将权重非凸地重参数化为尺度与方向分量,因而保持了鲁棒的收敛性。

ABSTRACT

Normalization methods such as batch [Ioffe and Szegedy, 2015], weight [Salimansand Kingma, 2016], instance [Ulyanov et al., 2016], and layer normalization [Baet al., 2016] have been widely used in modern machine learning. Here, we study the weight normalization (WN) method [Salimans and Kingma, 2016] and a variant called reparametrized projected gradient descent (rPGD) for overparametrized least-squares regression. WN and rPGD reparametrize the weights with a scale g and a unit vector w and thus the objective function becomes non-convex. We show that this non-convex formulation has beneficial regularization effects compared to gradient descent on the original objective. These methods adaptively regularize the weights and converge close to the minimum l2 norm solution, even for initializations far from zero. For certain stepsizes of g and w , we show that they can converge close to the minimum norm solution. This is different from the behavior of gradient descent, which converges to the minimum norm solution only when started at a point in the range space of the feature matrix, and is thus more sensitive to initialization.

研究动机与目标

  • 理解在过参数化模型中,权重归一化(WN)与重参数化投影梯度下降(rPGD)的隐式正则化效应。
  • 刻画 WN 与 rPGD 在非零初始化下如何收敛至接近最小 $̂²$ 范数解的解。
  • 比较 WN 与 rPGD 与标准梯度下降(GD)的收敛行为,特别是对初始化的敏感性。
  • 建立 WN 与 rPGD 实现几何收敛速率并逼近最小范数解的理论条件。
  • 探究学习率调度与重参数化在实现鲁棒隐式正则化中的作用。

提出的方法

  • 将权重矩阵 $x$ 重参数化为 $x = g w / \|w\|_2$,其中 $g \in \mathbb{R}$ 为尺度,$w \in \mathbb{R}^d$ 为方向向量,将原始的凸最小二乘问题转化为非凸优化问题。
  • 提出 rPGD 作为变体,其在保持 $\|w\|_2 = 1$ 的前提下,对单位范数方向 $w$ 执行投影梯度下降,同时更新尺度 $g$。
  • 分析 WN 与 rPGD 的连续时间极限,表明在适当的学习率缩放下,二者收敛至相同的流,称为 WN 流。
  • 证明当尺度参数 $g$ 得到适当控制时,损失可按几何速率下降,即使非凸形式中存在虚假驻点。
  • 采用两阶段学习率调度策略——初始阶段同时更新 $g$ 与 $w$,随后仅更新 $g$——以提升在更广泛初始化范围下的最小范数解收敛性能。
  • 在矩阵感知问题上进行实验,比较 GD、WN 与 rPGD 在恒定学习率与两阶段学习率下的最终解的核范数。

实验结果

研究问题

  • RQ1当初始化远离零点时,权重归一化(WN)与 rPGD 是否仍能收敛至最小 $̂²$ 范数解?与标准梯度下降相比,后者仅在零初始化时才能实现此效果。
  • RQ2WN 与 rPGD 中的非凸重参数化如何影响优化景观与收敛行为?
  • RQ3WN 与 rPGD 的连续时间极限之间有何关系?其与隐式正则化有何关联?
  • RQ4两阶段学习率调度是否能提升在更广泛初始化范围下对最小范数解的收敛性能?
  • RQ5在过参数化最小二乘问题中,WN 与 rPGD 与标准梯度下降相比,在最终解的范数大小与对初始化的鲁棒性方面表现如何?

主要发现

  • WN 与 rPGD 在广泛初始化条件下均能收敛至接近最小 $̂²$ 范数解的解,而标准梯度下降仅在零初始化时才能实现此效果。
  • WN 与 rPGD 的连续时间极限完全相同,称为 WN 流,表明在小步长极限下二者等价。
  • 当尺度参数 $g$ 得到适当控制时,即使在非凸形式中存在非全局驻点,损失仍能以几何速率下降。
  • 两阶段学习率调度策略(初始阶段同时更新 $g$ 与 $w$,随后仅更新 $g$)可使解更接近最小核范数解,且适用范围更广的初始尺度值 $g_0$。
  • 在矩阵感知实验中,WN 与 rPGD 在更广泛的初始化范围内均优于标准 GD,收敛至核范数更小的解,尤其在使用两阶段学习率时表现更优。
  • 实验结果显示,WN 与 rPGD 的最终解范数高度重合,验证了其在连续极限下的理论等价性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。