Skip to main content
QUICK REVIEW

[论文解读] On the Implicit Bias of Initialization Shape: Beyond Infinitesimal Mirror Descent

Shahar Azulay, Edward Moroshko|arXiv (Cornell University)|Feb 19, 2021
Stochastic Gradient Optimization Techniques参考文献 25被引用 7
一句话总结

本文提出一种新方法,通过分析参数初始化的形状——特别是各层之间权重的相对尺度——来表征过参数化神经网络中梯度流的隐式偏差,突破了无穷小镜像下降(IMD)的局限。该方法推导出多种架构的闭式隐式正则化项,包括权重未绑定的对角网络、全连接两层网络以及单个 ReLU 神经元,揭示了初始化形状对泛化行为的决定性影响。

ABSTRACT

Recent work has highlighted the role of initialization scale in determining the structure of the solutions that gradient methods converge to. In particular, it was shown that large initialization leads to the neural tangent kernel regime solution, whereas small initialization leads to so called "rich regimes". However, the initialization structure is richer than the overall scale alone and involves relative magnitudes of different weights and layers in the network. Here we show that these relative scales, which we refer to as initialization shape, play an important role in determining the learned model. We develop a novel technique for deriving the inductive bias of gradient-flow and use it to obtain closed-form implicit regularizers for multiple cases of interest.

研究动机与目标

  • 理解不同层之间权重相对尺度(初始化形状)如何影响过参数化模型中梯度下降的归纳偏差。
  • 克服无穷小镜像下降(IMD)的局限性,后者无法表征真实、非平凡架构中的隐式偏差。
  • 建立一个可推广的框架,推导出以往技术失效的模型中的精确隐式正则化项,包括多层和非线性网络。
  • 研究初始化形状在决定收敛至特定解方面的作用,特别是在 NTK 和“丰富”之外的区域。
  • 将隐式偏差的理论理解扩展到更复杂且实际的深度学习架构,如两层全连接网络和 ReLU 网络。

提出的方法

  • 提出一种新颖的重参数化技术,将模型动态表达为无穷小镜像下降(IMD)形式,同时保持隐式偏差并支持分析。
  • 使用非线性‘时间扭曲’变换,将原始动态映射到 IMD 框架中,从而推导出隐式正则化项。
  • 识别参数化中的自由度,使得动态可重新表达而不改变解路径。
  • 将该方法应用于推导特定架构的闭式隐式正则化项:权重未绑定的对角网络、初始化趋近于零的全连接两层线性网络,以及单个漏失 ReLU 神经元。
  • 利用 KKT 条件与对偶性,证明最终解对应于在约束下最小化正则化目标。
  • 定义关键初始化参数:尺度(α)、形状(s)与平衡度(δ),并推导其相互关系以表征隐式偏差。

实验结果

研究问题

  • RQ1不同层之间权重的相对尺度(初始化形状)如何影响深度网络中梯度下降的隐式偏差?
  • RQ2在真实、非平凡的架构中,能否在无穷小镜像下降框架之外表征梯度流的隐式偏差?
  • RQ3对于初始化趋近于零的两层全连接线性网络,其精确隐式正则化项是什么?
  • RQ4对于单个漏失 ReLU 神经元,在特定初始化形状下,梯度流的隐式偏差如何变化?
  • RQ5所提出的方法能否为以往 IMD 方法失效的模型推导出闭式正则化项?

主要发现

  • 本文确立了初始化形状——超越仅尺度——在决定深度学习中梯度下降归纳偏差方面起着决定性作用。
  • 对于权重未绑定的对角网络,隐式偏差对应于依赖于初始化形状的正则化目标的最小化。
  • 在初始化趋近于零的两层全连接线性网络中,解最小化一个反映层间相对初始化尺度的正则化范数。
  • 对于单个漏失 ReLU 神经元,隐式偏差导致最小化一个非凸、非光滑的正则化目标,最优解满足 KKT 条件。
  • 推导出的隐式正则化项为闭式,显式依赖于初始化参数 α(尺度)、s(形状)与 δ(平衡度),且这些参数通过代数恒等式相互关联。
  • 该方法成功表征了以往在 IMD 框架下难以处理的模型的隐式偏差,如标准的两层 ReLU 网络,通过时间扭曲对动态进行重参数化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。