[论文解读] Efficient batchwise dropout training using submatrices
本文提出批量dropout(batchwise dropout),一种通过在小批量(minibatch)内所有样本上应用相同的dropout掩码来加速深度神经网络训练的方法,从而实现高效的子矩阵计算。通过仅使用子矩阵计算活跃连接,该方法减少了浮点运算量(FLOPs)和内存使用量,将训练时间最多减少50%,且不损失测试准确率,同时在速度上优于独立dropout,且保持了相近的泛化性能。
Dropout is a popular technique for regularizing artificial neural networks. Dropout networks are generally trained by minibatch gradient descent with a dropout mask turning off some of the units---a different pattern of dropout is applied to every sample in the minibatch. We explore a very simple alternative to the dropout mask. Instead of masking dropped out units by setting them to zero, we perform matrix multiplication using a submatrix of the weight matrix---unneeded hidden units are never calculated. Performing dropout batchwise, so that one pattern of dropout is used for each sample in a minibatch, we can substantially reduce training times. Batchwise dropout can be used with fully-connected and convolutional neural networks.
研究动机与目标
- 为解决训练dropout正则化神经网络时计算成本高的问题,尤其是当隐藏层较大时。
- 探究在dropout集合规模庞大的情况下,是否必须为每个样本使用独立的dropout掩码以实现泛化。
- 通过在整批样本中应用相同的dropout模式,开发一种更高效的训练方法,从而支持基于子矩阵的计算。
- 在不损害模型性能或泛化能力的前提下,减少每轮训练的时间。
提出的方法
- 用每批次共享的单一dropout掩码替代每个样本的独立dropout掩码,并在所有样本中统一应用。
- 定义仅包含活跃单元的权重和激活的子矩阵——$W_k^{\text{dropout}}$ 和 $x_k^{\text{dropout}}$。
- 仅通过子矩阵乘法执行前向和反向传播,消除冗余运算。
- 在子矩阵上使用标准GEMM内核(如CUBLAS SGEMM),以利用硬件优化的矩阵乘法。
- 将该方法应用于全连接网络和卷积网络,包括残差网络和深层架构。
- 通过仅存储活跃隐藏单元及其对应的权重子矩阵,优化内存使用。
实验结果
研究问题
- RQ1在整批样本中应用相同的dropout模式,是否能在减少训练时间的同时保持泛化性能?
- RQ2批量dropout是否通过消除矩阵乘法中的冗余FLOPs,降低了计算开销?
- RQ3在标准基准测试中,批量dropout与独立dropout在测试准确率和训练速度方面相比如何?
- RQ4基于子矩阵计算的方法是否能高效地在GPU硬件上使用标准BLAS内核实现?
- RQ5在带宽受限的分布式训练环境中,批量dropout是否具有优势?
主要发现
- 在MNIST数据集上,批量dropout将每轮训练时间最多减少50%,且测试准确率与独立dropout几乎完全相同。
- 在CIFAR-10上使用小型卷积网络时,批量dropout在12次测试平均后得到的最小测试误差为7.70%,略高于独立dropout的7.63%。
- 在CIFAR-10上使用深层12层卷积网络时,尽管正则化水平相似,批量dropout将每轮训练时间减少到独立dropout的一半以下。
- 该方法在实现与独立dropout几乎相同的模型性能的同时,显著提升了训练效率,归功于子矩阵计算。
- 通过仅存储活跃单元及其对应的子矩阵,该方法减少了内存使用,提升了GPU上的缓存效率。
- 作者观察到,批量dropout具有略微更强的正则化效果,测试误差曲线整体向左移动,表明在较低dropout率下泛化能力更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。