[论文解读] Stochastic Layer-Wise Precision in Deep Neural Networks
本文提出了一种在深度神经网络中采用随机、逐层精度分配的方法,其中每个层在训练过程中使用Gumbel-Softmax采样动态探索不同的位宽。该方法在固定预算下学习最优精度配置,提升了泛化能力,并在MNIST和ILSVRC12上优于均匀精度基线,MNIST误差降低最高达1.41%,ILSVRC12降低2.22%。
Low precision weights, activations, and gradients have been proposed as a way to improve the computational efficiency and memory footprint of deep neural networks. Recently, low precision networks have even shown to be more robust to adversarial attacks. However, typical implementations of low precision DNNs use uniform precision across all layers of the network. In this work, we explore whether a heterogeneous allocation of precision across a network leads to improved performance, and introduce a learning scheme where a DNN stochastically explores multiple precision configurations through learning. This permits a network to learn an optimal precision configuration. We show on convolutional neural networks trained on MNIST and ILSVRC12 that even though these nets learn a uniform or near-uniform allocation strategy respectively, stochastic precision leads to a favourable regularization effect improving generalization.
研究动机与目标
- 探究与均匀精度分配相比,跨层异构精度分配是否能提升深度神经网络的性能。
- 开发一种可微分的随机机制,以在固定总位宽预算下学习每层的最优精度配置。
- 评估随机精度探索是否起到正则化作用,从而在不牺牲硬件加速可预测性的前提下提升泛化能力。
- 证明通过Gumbel-Softmax采样学习精度配置可获得比固定均匀精度设置更高的准确率。
提出的方法
- 该方法使用Gumbel-Softmax松弛技术,在训练过程中对每层采样不同的精度配置(位宽),从而实现对离散精度选择的可微分优化。
- 每层的精度被建模为在可能的位宽上的分类分布,其可学习的logits由网络参数化。
- 总精度预算受到约束,确保硬件加速的可预测性,并支持高效部署。
- 通过重参数化实现梯度估计,使得即使精度为离散值,也能通过反向传播进行优化。
- 模型通过标准反向传播进行端到端训练,每轮前向传播使用随机的位宽分配。
- 在推理阶段,使用从学习到的Gumbel-Softmax分布中采样出最可能的精度配置进行硬分配。
实验结果
研究问题
- RQ1与均匀精度分配相比,学习跨层的异构精度配置是否能提升深度神经网络的性能?
- RQ2随机探索精度配置是否起到正则化作用,从而提升泛化能力?
- RQ3在相同的总位宽预算下,学习到的精度分配与均匀分配在图像分类任务上的表现如何比较?
- RQ4模型是否学习到有意义的精度分布,例如为早期层分配更少的位数,为深层分配更多的位数?
- RQ5该方法是否能在保持硬件加速确定性的同时提升模型准确率?
主要发现
- 在MNIST上,学习到的精度模型在10位预算下达到2.32%的测试误差,优于均匀基线的3.73%。
- 在MNIST上使用40位预算时,学习到的模型误差降至1.14%,而均匀基线为1.18%。
- 在ILSVRC12上,学习到的精度模型将top-1误差从均匀分配的49.68%降低至14位预算下的48.54%。
- ILSVRC12模型学习到了非均匀分配,为后期层分配9位,早期层分配3–4位,表明具备对网络架构的感知能力。
- 在所有预算下,学习到的精度配置均收敛更快且测试误差更低,证明了其正则化优势。
- 该方法在相同位宽预算下实现了更高的准确率,表明精度分配是一种可调节、可学习的超参数,能够提升模型效率与性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。