Skip to main content
QUICK REVIEW

[论文解读] Model compression as constrained optimization, with application to neural nets. Part V: combining compressions

Miguel Á. Carreira-Perpiñán, Yerlan Idelbayev|arXiv (Cornell University)|Jul 9, 2021
Neural Networks and Applications参考文献 55被引用 5
一句话总结

本文提出了一种约束优化框架,通过将权重矩阵表示为独立压缩组件的加法组合,整合了多种模型压缩技术(如低秩近似、剪枝和量化)。该方法联合优化这些组件,在实现极低精度损失的同时获得更高的压缩率,例如将ResNets和AlexNet压缩至每权重1比特而无误差退化,而VGG则更受益于低秩与剪枝的组合。

ABSTRACT

Model compression is generally performed by using quantization, low-rank approximation or pruning, for which various algorithms have been researched in recent years. One fundamental question is: what types of compression work better for a given model? Or even better: can we improve by combining compressions in a suitable way? We formulate this generally as a problem of optimizing the loss but where the weights are constrained to equal an additive combination of separately compressed parts; and we give an algorithm to learn the corresponding parts' parameters. Experimentally with deep neural nets, we observe that 1) we can find significantly better models in the error-compression space, indicating that different compression types have complementary benefits, and 2) the best type of combination depends exquisitely on the type of neural net. For example, we can compress ResNets and AlexNet using only 1 bit per weight without error degradation at the cost of adding a few floating point weights. However, VGG nets can be better compressed by combining low-rank with a few floating point weights.

研究动机与目标

  • 为解决选择最优压缩技术以应对神经网络压缩的挑战,特别是当单一方法无法充分挖掘互补优势时。
  • 开发一种统一框架,实现多种压缩技术的联合优化,而非顺序或孤立应用。
  • 探究通过加法分解组合压缩类型是否能实现比单一技术更优的模型大小、推理速度与精度之间的权衡。
  • 通过实证评估在ResNet、AlexNet和VGG等多样化架构上联合压缩的有效性,识别出针对不同架构的最优组合策略。

提出的方法

  • 将模型压缩建模为一个约束优化问题,其中原始权重矩阵被分解为若干组件之和:W = W₁ + W₂ + W₃,每个组件代表一种不同的压缩类型(如低秩、稀疏、量化)。
  • 采用可微分优化框架,联合学习各组件的参数,支持端到端训练与反向传播。
  • 应用交替优化策略:固定除一个组件外的所有组件,通过梯度下降优化该组件,循环遍历各组件直至收敛。
  • 将标准压缩技术——低秩近似(SVD)、基于幅值的剪枝和1比特量化——整合进加法分解框架中。
  • 使用软阈值和直通估计器对稀疏性和量化约束进行可微分松弛,以支持梯度流动。
  • 在ImageNet上对ResNet、AlexNet和VGG架构进行验证,测量边缘设备(如Jetson Nano)上的精度、模型大小和推理延迟。

实验结果

研究问题

  • RQ1通过加法分解组合多种压缩技术,是否能实现比单独应用各技术更优的压缩-精度权衡?
  • RQ2哪些压缩技术组合(如低秩+剪枝、量化+剪枝)在特定神经网络架构上表现最佳?
  • RQ3压缩的加法组合是否能在保持或提升模型精度的同时实现更高的压缩率,相比基线方法?
  • RQ4联合压缩的性能在不同模型架构(如ResNet、AlexNet和VGG)之间如何变化?

主要发现

  • 将低秩近似与1比特量化及剪枝相结合,可在无精度损失的情况下将AlexNet和ResNet压缩至每权重1比特,于Jetson Nano上实现高达72.15×的压缩率。
  • 对于VGG网络,结合低秩与剪枝及量化的效果优于仅使用量化,L₃模型变体的压缩率可达90.4×。
  • 与原始Caffe-AlexNet相比,该方法在Jetson Nano GPU上实现7.33×的加速,在CPU上实现3.93×加速,模型大小仅为3.7 MB。
  • 运行时测量显示,联合压缩方法将L₃模型的推理时间缩短至CPU上44.80 ms、GPU上6.72 ms,在速度和大小方面均优于基线模型。
  • 加法组合框架使更多权重矩阵能在无损失情况下被压缩,因其结合了多种压缩流形的表示能力。
  • 最优压缩策略高度依赖于网络架构:ResNets和AlexNet在结合1比特量化与剪枝时收益最大,而VGG则更受益于低秩与剪枝的组合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。