Skip to main content
QUICK REVIEW

[论文解读] Position-based Scaled Gradient for Model Quantization and Sparse Training.

Jangho Kim, KiYoon Yoo|arXiv (Cornell University)|May 22, 2020
Advanced Neural Network Applications参考文献 24被引用 6
一句话总结

本文提出基于位置的梯度缩放(PSG),一种根据权重向量在权重空间中的位置来缩放梯度的方法,以提升模型压缩效果。通过在变形的权重空间中重参数化梯度下降,PSG 作为一种正则化方法,减少了全精度模型与压缩模型之间的分布差距,实现了在极低比特宽度下在 CIFAR-10/100 和 ImageNet 上的无缝部署,且性能表现强劲。

ABSTRACT

We propose the position-based scaled gradient (PSG) that scales the gradient depending on the position of a weight vector to make it more compression-friendly. First, we theoretically show that applying PSG to the standard gradient descent (GD), which is called PSGD, is equivalent to the GD in the warped weight space, a space made by warping the original weight space via an appropriately designed invertible function. Second, we empirically show that PSG acting as a regularizer to a weight vector is very useful in model compression domains such as quantization and sparse training. PSG reduces the gap between the weight distributions of a full-precision model and its compressed counterpart. This enables the versatile deployment of a model either as an uncompressed mode or as a compressed mode depending on the availability of resources. The experimental results on CIFAR-10/100 and Imagenet datasets show the effectiveness of the proposed PSG in both domains of sparse training and quantization even for extremely low bits.

研究动机与目标

  • 解决量化和稀疏训练过程中全精度模型与压缩模型之间的分布差距问题。
  • 通过正则化权重分布,提升压缩模型的兼容性与性能。
  • 根据资源可用性,实现模型在全精度与压缩模式下的灵活部署。
  • 从理论和实证两方面验证 PSG 通过梯度重加权提升压缩友好性的有效性。

提出的方法

  • PSG 使用可逆的、与位置相关的函数,根据权重向量在权重空间中的位置来缩放梯度。
  • 该方法在理论上等价于在变形权重空间中的标准梯度下降,其中变形函数被设计用于增强压缩特性。
  • 梯度缩放作为一种正则化手段,促使全精度模型与压缩模型的权重分布趋于一致。
  • 该方法可无缝集成到标准训练流程中,无需架构修改,具有广泛的适用性。
  • 变形函数可微且可逆,在保持优化路径的同时改善了压缩行为。
  • PSG 在反向传播过程中应用,根据权重位置调整梯度大小,促进稀疏性和量化稳定性。

实验结果

研究问题

  • RQ1基于权重位置的梯度缩放能否减少全精度模型与压缩模型之间的分布差距?
  • RQ2PSG 在低比特量化和稀疏训练中如何提升模型性能?
  • RQ3PSG 是否能实现模型在无压缩与压缩模式下的无缝部署?
  • RQ4PSG 在多样化的数据集和模型架构(包括 ImageNet)上是否均有效?
  • RQ5PSG 是否可无缝集成到标准训练流程中,而无需架构修改?

主要发现

  • PSG 显著减小了全精度模型与量化模型之间的分布差距,提升了压缩设置下的泛化能力。
  • 该方法即使在极低比特宽度下也能实现有效的模型压缩,在 CIFAR-10/100 和 ImageNet 上表现优异。
  • 使用 PSG 训练的模型在无压缩与压缩模式下均保持高精度,支持灵活部署。
  • PSG 作为一种正则化方法,能稳定量化与稀疏性约束下的训练过程。
  • 与变形权重空间中梯度下降的理论等价性,证实了该方法的优化稳定性。
  • 实证结果表明,PSG 在量化与稀疏训练中均带来一致的性能提升,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。