Skip to main content
QUICK REVIEW

[论文解读] The Effect of Network Width on the Performance of Large-batch Training

Lingjiao Chen, Hongyi Wang|arXiv (Cornell University)|Jun 11, 2018
Stochastic Gradient Optimization Techniques参考文献 24被引用 8
一句话总结

本文研究了神经网络宽度和深度对大批次训练性能的影响,理论和实证结果表明,更宽、更浅的网络由于梯度多样性更高,能够在大批次下保持快速收敛,而更深的网络则收敛更慢。其主要贡献在于证明:在参数量固定的情况下,增加宽度可提升网络对大批次训练的适应性,通过增强梯度多样性,实现更好的分布式训练可扩展性,且不会导致性能下降。

ABSTRACT

Distributed implementations of mini-batch stochastic gradient descent (SGD) suffer from communication overheads, attributed to the high frequency of gradient updates inherent in small-batch training. Training with large batches can reduce these overheads; however, large batches can affect the convergence properties and generalization performance of SGD. In this work, we take a first step towards analyzing how the structure (width and depth) of a neural network affects the performance of large-batch training. We present new theoretical results which suggest that--for a fixed number of parameters--wider networks are more amenable to fast large-batch training compared to deeper ones. We provide extensive experiments on residual and fully-connected neural networks which suggest that wider networks can be trained using larger batches without incurring a convergence slow-down, unlike their deeper variants.

研究动机与目标

  • 理解神经网络架构(特别是宽度和深度)如何影响大批次训练的性能。
  • 分析梯度多样性作为决定大批次训练有效性的关键因素的作用。
  • 研究在总参数量固定的情况下,更宽的网络是否比更深的网络更适用于大批次训练。
  • 提供理论和实证证据,证明宽度可提升梯度多样性,从而实现大批次下的更快收敛。

提出的方法

  • 对在随机权重初始化下,两层全连接线性和非线性网络以及多层线性网络的梯度多样性进行理论分析。
  • 推导不同数据点梯度之间内积的期望值,以量化梯度多样性随宽度和深度的变化。
  • 使用独立同分布的高斯权重和激活函数,计算各层梯度乘积的期望值。
  • 推导深层线性网络中梯度内积的闭式表达式,表明梯度多样性随宽度单调增加,随深度单调减少。
  • 在CIFAR10、MNIST、EMNIST、Gisette和合成数据集上进行实证评估,固定参数量,改变深度和宽度。
  • 测量在不同批量大小下达到96%准确率所需的收敛速度(训练轮数),以识别收敛变慢的批量大小阈值 $B^*$。

实验结果

研究问题

  • RQ1网络宽度如何影响大批次训练中的梯度多样性?
  • RQ2与增加深度相比,增加宽度是否能提升大批次SGD的收敛速度?
  • RQ3是否存在网络宽度与收敛变慢的阈值批量大小 $B^*$ 之间的理论关系?
  • RQ4在深层线性网络中,梯度多样性如何随深度和宽度变化?
  • RQ5更宽的网络能否在大批次下保持快速收敛,而更深的网络则不能?

主要发现

  • 在总参数量固定的情况下,更宽的网络相比更深的网络表现出更高的梯度多样性。
  • 在参数量固定时,增加宽度并减少深度可使梯度多样性单调增加。
  • 收敛速度变慢的阈值批量大小 $B^*$ 对更深的网络更小,表明其对大批次训练的适应性更差。
  • 实证结果证实,更宽的网络在大批次下收敛所需轮数更少,而更深的网络则出现收敛变慢。
  • 理论分析表明,梯度多样性随宽度增加而增加,随深度增加而减少,可解释观察到的实证行为。
  • 本研究证明,通过架构设计(特别是宽度)可提升分布式训练的可扩展性,实现更快的大批次收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。