[论文解读] Generalized Ternary Connect: End-to-End Learning and Compression of Multiplication-Free Deep Neural Networks
该论文提出广义三元连接(GTC),一种端到端可微方法,可学习深度神经网络中量化级别的数量及其值(作为2的整数次幂),通过位移操作实现免乘法推理。GTC在MNIST和CIFAR-10上实现了最先进的压缩效果,且精度损失极小,并通过FPGA和树莓派仿真展示了硬件效率,同时作为新型优化器,可提升训练收敛性。
The use of deep neural networks in edge computing devices hinges on the balance between accuracy and complexity of computations. Ternary Connect (TC) \cite{lin2015neural} addresses this issue by restricting the parameters to three levels $-1, 0$, and $+1$, thus eliminating multiplications in the forward pass of the network during prediction. We propose Generalized Ternary Connect (GTC), which allows an arbitrary number of levels while at the same time eliminating multiplications by restricting the parameters to integer powers of two. The primary contribution is that GTC learns the number of levels and their values for each layer, jointly with the weights of the network in an end-to-end fashion. Experiments on MNIST and CIFAR-10 show that GTC naturally converges to an `almost binary' network for deep classification networks (e.g. VGG-16) and deep variational auto-encoders, with negligible loss of classification accuracy and comparable visual quality of generated samples respectively. We demonstrate superior compression and similar accuracy of GTC in comparison to several state-of-the-art methods for neural network compression. We conclude with simulations showing the potential benefits of GTC in hardware.
研究动机与目标
- 为解决在边缘设备上部署深度神经网络时计算复杂度过高的挑战,通过在推理过程中消除乘法运算。
- 通过允许任意数量的量化级别(受限于2的整数次幂),推广三元连接(Ternary Connect),以支持高效的位移操作。
- 端到端联合学习量化级别数量及其值,与网络权重共同优化,兼顾精度与模型压缩。
- 通过FPGA和树莓派仿真展示硬件效率提升,实现更低功耗与更低延迟。
- 探索GTC作为新型优化器的潜力,通过退火量化损失项,提升训练收敛性。
提出的方法
- GTC将网络权重量化为集合 {0} ∪ {±2^k | k ∈ ℤ} 中的值,通过位移操作实现免乘法推理。
- 该方法引入可学习参数以参数化量化函数,支持灵活的形状,如双曲或S型映射。
- 通过可学习的温度和缩放参数定义可微量化函数,使反向传播能够通过量化过程。
- 损失函数包含蒸馏项(λ₁)以保持网络行为,以及比特成本惩罚项(λ₂)以控制使用比特数。
- 每权重的比特数通过学习到的量化分布的期望熵计算,实现压缩与精度的端到端联合优化。
- 通过在训练过程中退火λ₂,将GTC的一个变体用作优化器,初始设置高稀疏性,逐步降低以允许更高精度。
实验结果
研究问题
- RQ1能否在端到端训练中使深度神经网络同时学习量化级别的数量及其值(作为2的整数次幂)?
- RQ2与现有最先进的压缩技术相比,所提方法是否实现了高模型压缩且精度损失极小?
- RQ3所学的量化方案能否高效映射到硬件,实现功耗与延迟的显著降低?
- RQ4GTC能否作为具有竞争力的优化器,其训练收敛性与最终精度优于标准SGD?
- RQ5在不同正则化设置下,模型精度(比特数)与精度之间的权衡关系如何?
主要发现
- 在CIFAR-10上的VGG-16中,GTC实现了98.8%的测试精度,平均每权重仅使用2比特,与全精度模型精度相当。
- 在MNIST上,当λ₂ = 0时,GTC实现99.3%的精度,平均每权重5.25比特;当λ₂ = 10⁻³时,压缩至2比特,精度为95.0%。
- FPGA仿真显示,每操作功耗降低79.6%,从49mW(乘法)降至10mW(位移)。
- 树莓派仿真显示,每操作延迟降低28%,从93ns降至67ns,得益于用位移替代乘法。
- 采用退火λ₂的GTC变体优于标准SGD和固定λ₂的GTC变体,在前40k次迭代中,其训练精度超越32位基线。
- 在深层架构中,GTC自然收敛至一种‘近乎二值’的网络结构,表明训练过程中对低精度表示存在内在偏好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。