QUICK REVIEW
[论文解读] Data-Dependent Path Normalization in Neural Networks
Behnam Neyshabur, Ryota Tomioka|arXiv (Cornell University)|Nov 20, 2015
Neural Networks and Applications参考文献 15被引用 4
一句话总结
本文通过定义一种依赖数据的路径归一化机制,提出了一种统一的神经网络归一化、正则化与优化框架,该机制在Path-SGD与批量归一化之间进行插值。提出了DDP-SGD,一种对权重重参数化不变的近似最速下降方法,并表明其近似于对角自然梯度,通过依赖数据的复杂度度量实现了改进的不变性与泛化性能。
ABSTRACT
We propose a unified framework for neural net normalization, regularization and optimization, which includes Path-SGD and Batch-Normalization and interpolates between them across two different dimensions. Through this framework we investigate issue of invariance of the optimization, data dependence and the connection with natural gradients.
研究动机与目标
- 将现有的深度学习归一化与优化技术统一于单一复杂度度量之下。
- 研究数据依赖性与参数化不变性在神经网络优化中的作用。
- 开发一种新的优化方法DDP-SGD,无论数据依赖程度如何,均保持对权重重参数化的不变性。
- 将所提出的框架与自然梯度方法联系起来,特别是通过Fisher信息矩阵的对角近似。
- 刻画ReLU网络中路径雅可比矩阵的秩,并理解其对模型表达能力与退化现象的影响。
提出的方法
- 通过归一化矩阵R定义每个节点的复杂度度量γv,以控制数据依赖性。
- 以路径正则化为基础,其中ℓ2路径正则化项对网络中所有路径上权重乘积的平方求和。
- 提出两种优化方法:归一化重参数化(类似批量归一化)与DDP-SGD(路径正则化空间中的近似最速下降)
- 通过前向与反向传播推导DDP-SGD,支持高效的梯度计算与实现。
- 证明当使用激活的二阶矩作为R时,DDP-SGD在完全数据依赖下可近似对角自然梯度。
- 通过分析表明,DDP-SGD对节点级权重缩放保持不变性,无论R的数据依赖性如何。
实验结果
研究问题
- RQ1如何在统一框架下将Path-SGD与批量归一化统一于归一化与优化方法之中?
- RQ2数据依赖性在决定神经网络优化中的不变性与泛化性能方面起什么作用?
- RQ3能否推导出一种高效且参数化不变的优化方法,以近似自然梯度?
- RQ4路径雅可比矩阵的秩如何与网络架构和参数配置相关联?
- RQ5控制ReLU网络中路径向量张成空间维度的组合结构是什么?
主要发现
- 无论归一化矩阵R的数据依赖程度如何,DDP-SGD对权重重参数化保持不变。
- 通过选择R,该框架在Path-SGD(数据无关)与批量归一化(完全数据依赖)之间实现插值。
- 当采用完全数据依赖时,DDP-SGD近似对角自然梯度,提供一种计算高效的全自然梯度替代方法。
- 路径雅可比矩阵J(w)的秩通常为|E| − |V_internal|,其中|E|为边数,|V_internal|为内部节点数。
- 路径向量φ(x)的张成空间维度可能小于路径数量,尤其当存在线性层或退化ReLU单元时。
- 使路径雅可比矩阵达到满秩的参数集合是典型的(具有全勒贝格测度),意味着在宽网络中满秩行为是普遍的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。