Skip to main content
QUICK REVIEW

[论文解读] Asymptotics of Wide Convolutional Neural Networks

Anders Andreassen, Ethan Dyer|arXiv (Cornell University)|Aug 19, 2020
Stochastic Gradient Optimization Techniques参考文献 34被引用 14
一句话总结

本文提出一种图解框架,用于推导宽卷积神经网络(CNN)的缩放律,表明由于随 𝒪(n⁻¹) 衰减的有限宽度修正,有限宽度CNN在实践中优于无限宽度对应模型。作者证明,有限宽度与无限宽度模型之间的测试损失差异呈 𝒪(n⁻¹) 缩放,与经验观察一致:有限宽度网络的泛化性能可能更好或更差,具体取决于优化细节。

ABSTRACT

Wide neural networks have proven to be a rich class of architectures for both theory and practice. Motivated by the observation that finite width convolutional networks appear to outperform infinite width networks, we study scaling laws for wide CNNs and networks with skip connections. Following the approach of (Dyer & Gur-Ari, 2019), we present a simple diagrammatic recipe to derive the asymptotic width dependence for many quantities of interest. These scaling relationships provide a solvable description for the training dynamics of wide convolutional networks. We test these relations across a broad range of architectures. In particular, we find that the difference in performance between finite and infinite width models vanishes at a definite rate with respect to model width. Nonetheless, this relation is consistent with finite width models generalizing either better or worse than their infinite width counterparts, and we provide examples where the relative performance depends on the optimization details.

研究动机与目标

  • 为了理解为何有限宽度卷积神经网络(CNN)在实践中常优于其无限宽度对应模型,尽管后者在分析上更易处理。
  • 为了将无限宽度神经正切核(NTK)形式化推广至具有跳跃连接和池化层的卷积架构。
  • 为了使用图解技术推导宽CNN中相关函数的一般缩放律。
  • 为了以宽度相关修正项的形式量化有限宽度CNN收敛至其无限宽度极限的速率。
  • 为了在深度非线性CNN中实证验证损失和NTK方差的预测 𝒪(n⁻¹) 缩放。

提出的方法

  • 提出一种基于费曼规则的广义图解方法,用于计算宽CNN中的相关函数,扩展了先前对全连接网络的研究。
  • 为具有卷积、跳跃连接、全连接和全局平均池化层的CNN中的相关函数提出缩放假设。
  • 利用该假设约束NTK和线性化训练动力学的有限宽度修正。
  • 将该形式化方法应用于计算训练过程中NTK和损失的期望演化,表明修正项呈 𝒪(n⁻¹) 缩放。
  • 在CIFAR-10和MNIST子集上,通过改变网络宽度,实证验证了损失差异和NTK方差的 𝒪(n⁻¹) 缩放。
  • 通过权重初始化和矩计算,证明了深度线性CNN中NTK方差的 𝒪(n⁻¹) 缩放,适用于具有卷积、跳跃连接和全局平均池化层的结构。

实验结果

研究问题

  • RQ1在卷积神经网络中,有限宽度修正如何随网络宽度缩放?
  • RQ2为何尽管无限宽度模型在分析上更简单,有限宽度CNN有时仍优于无限宽度模型?
  • RQ3能否建立一个统一的图解框架,描述具有跳跃连接和池化层的宽CNN的渐近行为?
  • RQ4从测试损失和NTK演化角度,有限宽度CNN收敛至其无限宽度极限的速率如何?
  • RQ5有限宽度与无限宽度模型的相对性能是否依赖于优化超参数(如停止准则)?

主要发现

  • 有限宽度与无限宽度CNN之间测试损失的差异呈 𝒪(n⁻¹) 缩放,证实了其普遍收敛速率。
  • 在CIFAR-10和MNIST上的实证结果表明,预测的 𝒪(n⁻¹) 缩放能准确描述不同架构和激活函数下的损失差异。
  • 对于具有卷积、跳跃连接和全局平均池化层的深度线性CNN,NTK方差被证明呈 𝒪(n⁻¹) 缩放。
  • 对于单隐藏层非线性CNN,通过直接计算权重矩期望,也证明了NTK方差呈 𝒪(n⁻¹) 缩放。
  • 有限宽度CNN可能优于或劣于其无限宽度对应模型,具体取决于训练超参数,与 𝒪(n⁻¹) 修正模型一致。
  • 所提出的图解方法成功将无限宽度形式化推广至卷积架构,实现了对有限宽度效应的系统性分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。