[论文解读] Learning Discrete Weights Using the Local Reparameterization Trick
该论文提出LR-nets,一种通过中心极限定理将预激活分布近似为高斯分布,从而使用改进的局部重参数化技巧训练具有离散二值或三值权重的深度神经网络的方法。该方法实现了对离散权重的有效反向传播,在MNIST、CIFAR-10和ImageNet上实现了最先进精度,其中三值网络由于更强的表征能力,表现优于二值网络。
Recent breakthroughs in computer vision make use of large deep neural networks, utilizing the substantial speedup offered by GPUs. For applications running on limited hardware, however, high precision real-time processing can still be a challenge. One approach to solving this problem is training networks with binary or ternary weights, thus removing the need to calculate multiplications and significantly reducing memory size. In this work, we introduce LR-nets (Local reparameterization networks), a new method for training neural networks with discrete weights using stochastic parameters. We show how a simple modification to the local reparameterization trick, previously used to train Gaussian distributed weights, enables the training of discrete weights. Using the proposed training we test both binary and ternary models on MNIST, CIFAR-10 and ImageNet benchmarks and reach state-of-the-art results on most experiments.
研究动机与目标
- 解决在低功耗、内存受限硬件上训练具有离散权重(二值或三值)的深度神经网络的挑战。
- 通过使用预激活分布的平滑近似,克服离散权重在反向传播中的不可微性问题。
- 与直通估计器或随机权重采样等现有方法相比,提升训练的稳定性和性能。
- 评估三值权重是否在性能与计算效率之间提供了优于二值权重的更好权衡。
- 证明一种原理性、可微分的离散预激活近似方法能够实现在低精度网络中的最先进结果。
提出的方法
- 该方法利用李雅普诺夫中心极限定理,将每个神经元的预激活建模为高斯分布,从而实现可微分的反向传播。
- 应用改进的局部重参数化技巧从预激活分布中采样,使梯度能够通过离散权重流动。
- 从学习到的分布中采样随机权重,并在重参数化的预激活上使用标准反向传播进行网络训练。
- 对于二值权重,该方法使用温度控制的Sigmoid函数近似符号函数,而三值权重则通过三点离散分布建模。
- 该方法使用批量归一化、权重衰减和学习率调度来在所有设置下稳定训练。
- 该方法避免了对直通梯度或单独的随机权重更新的需求,转而依赖于对预激活的连续、可微分近似。
实验结果
研究问题
- RQ1是否可以通过对离散预激活的平滑、可微分近似,实现对二值和三值权重网络的有效训练?
- RQ2与直通估计器或随机权重采样等现有方法相比,该方法的性能如何?
- RQ3通过中心极限定理建模预激活分布,是否相比直接梯度近似能带来更好的优化稳定性和准确性?
- RQ4二值与三值权重网络之间是否存在显著的性能差距,如果有,原因是什么?
- RQ5该方法是否能在包含ImageNet在内的大规模基准测试中,实现使用离散权重的最先进结果?
主要发现
- 在ImageNet上,采用三值权重的LR-net将top-1错误率降至36.5%,优于XNOR-Net(48.8%)和Binary-Weight-Network(40.1%)等先前方法。
- 在ImageNet上使用ResNet-18时,三值LR-net的top-5错误率为15.2%,而二值版本为17.7%,XNOR-Net为26.8%。
- 在MNIST和CIFAR-10上,三值LR-net的测试错误率仅比全精度参考模型高出1-2%,表现出强大的泛化能力。
- 三值网络的训练更加稳定,且对超参数调优的需求更低,表明其具有更优的优化动力学。
- 该方法在所有评估的基准测试(包括ImageNet)上均实现了最先进结果,无论使用二值还是三值权重。
- 卷积核可视化显示,LR-net在使用全精度初始化时,能够较好地保留全精度滤波器的结构模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。