Skip to main content
QUICK REVIEW

[论文解读] Compressibility Loss for Neural Network Weights

Çağlar Aytekin, Francesco Cricri|arXiv (Cornell University)|May 3, 2019
Neural Networks and Applications参考文献 7被引用 7
一句话总结

本文提出一种基于L1与L2范数比值的可压缩性损失,用于训练具有高度可压缩权重的神经网络。通过最小化该损失,该方法同时诱导稀疏性和低熵非零权重,实现了最先进的压缩比——在98%稀疏度下最高达102.76,同时保持了具有竞争力的准确率。

ABSTRACT

In this paper we apply a compressibility loss that enables learning highly compressible neural network weights. The loss was previously proposed as a measure of negated sparsity of a signal, yet in this paper we show that minimizing this loss also enforces the non-zero parts of the signal to have very low entropy, thus making the entire signal more compressible. For an optimization problem where the goal is to minimize the compressibility loss (the objective), we prove that at any critical point of the objective, the weight vector is a ternary signal and the corresponding value of the objective is the squared root of the number of non-zero elements in the signal, thus directly related to sparsity. In the experiments, we train neural networks with the compressibility loss and we show that the proposed method achieves weight sparsity and compression ratios comparable with the state-of-the-art.

研究动机与目标

  • 开发一种训练目标,以超越单纯稀疏性的方式提升神经网络权重的可压缩性。
  • 从理论上和实证上证明,最小化可压缩性损失可同时促进稀疏性和低熵非零权重分布。
  • 在保持模型准确率的前提下,实现与最先进方法相当或更优的压缩比。
  • 探索课程学习(逐步增加损失权重)对模型性能与可压缩性的影响。
  • 在稀疏度、量化和整体压缩效率方面,对现有方法进行验证。

提出的方法

  • 可压缩性损失定义为 $ L(\mathbf{x}) = \frac{||\mathbf{x}||_1}{||\mathbf{x}||_2} $,最初被提出作为负稀疏性的度量。
  • 理论分析证明,在该损失的任意临界点,权重向量会变为三值结构,取值为 $\{-c, 0, c\}$,其中 $ c = \frac{||\mathbf{x}||_2^2}{||\mathbf{x}||_1} $。
  • 该损失函数同时鼓励稀疏性和非零权重的低熵,从而提升整体可压缩性。
  • 在训练后对非零权重应用量化,使用k-means聚类(卷积层使用256个聚类,全连接层使用32个聚类)。
  • 采用掩码压缩策略,仅存储非零权重的位置及其值,从而提高压缩效率。
  • 采用课程学习方法,将损失权重 $ \lambda $ 从0逐步增加至每轮0.007,以稳定训练并在高稀疏度下提升性能。

实验结果

研究问题

  • RQ1最小化可压缩性损失 $ \frac{||\mathbf{x}||_1}{||\mathbf{x}||_2} $ 是否能同时实现稀疏性和低熵权重分布?
  • RQ2可压缩性损失是否在临界点诱导出三值权重结构?其理论依据是什么?
  • RQ3在高稀疏度下,该方法与最先进方法相比,在压缩比和准确率方面表现如何?
  • RQ4在训练过程中逐步增加损失权重是否能提升模型鲁棒性和压缩性能?
  • RQ5该方法是否能实现优于仅关注稀疏性或量化的现有方法的压缩效率?

主要发现

  • 可压缩性损失在临界点诱导出三值权重结构,非零权重仅取两个关于零对称的值。
  • 在98%稀疏度下,该方法实现了102.76的压缩比,显著优于基线方法在极端稀疏度下的表现。
  • 采用课程学习(渐变设置)时,该方法在97%稀疏度下准确率保持在85%以上,在98%稀疏度下达到76.57%,表现出良好的鲁棒性。
  • 与UDNN相比,该方法在准确率-压缩比权衡上表现更优,实现了在相当或更高压缩比下的更高准确率。
  • 尽管Smallify和TDrop在中等稀疏度下准确率更高,但CNET配合渐变训练在极端稀疏度下仍保持更优性能,表明其具有更优的可压缩性。
  • 掩码压缩提升了压缩效率,实现15.05的压缩比,优于标准压缩的13.32,验证了其在流水线中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。