Skip to main content
QUICK REVIEW

[论文解读] An Information-Theoretic Justification for Model Pruning

Berivan Isik, Tsachy Weissman|arXiv (Cornell University)|Feb 16, 2021
Adversarial Robustness in Machine Learning被引用 9
一句话总结

该论文提出 SuRP,一种基于率失真理论的新型神经网络剪枝方法,将模型压缩建模为压缩率与输出失真之间的信息论权衡。通过基于输出扰动和权重分布推导失真度量,作者证明剪枝在最优压缩下是理论必需的,并在 CIFAR-10 和 ImageNet 上验证 SuRP 在相同稀疏度水平下优于当前最先进基线方法,准确率更高。

ABSTRACT

We study the neural network (NN) compression problem, viewing the tension between the compression ratio and NN performance through the lens of rate-distortion theory. We choose a distortion metric that reflects the effect of NN compression on the model output and derive the tradeoff between rate (compression) and distortion. In addition to characterizing theoretical limits of NN compression, this formulation shows that \emph{pruning}, implicitly or explicitly, must be a part of a good compression algorithm. This observation bridges a gap between parts of the literature pertaining to NN and data compression, respectively, providing insight into the empirical success of model pruning. Finally, we propose a novel pruning strategy derived from our information-theoretic formulation and show that it outperforms the relevant baselines on CIFAR-10 and ImageNet datasets.

研究动机与目标

  • 通过将率失真理论应用于模型剪枝,弥合神经网络压缩与经典数据压缩之间的差距。
  • 确定反映输出扰动的失真度量下,有损神经网络压缩的理论极限。
  • 通过证明最小失真率需要稀疏模型,阐明剪枝在最优压缩中本质上是必要的。
  • 基于信息论原则,提出一种新型剪枝策略——SuRP,其性能优于现有方法。

提出的方法

  • 定义一种失真度量,用于上界神经网络输出因权重压缩而产生的扰动。
  • 使用重尾分布对神经网络权重分布进行建模,以反映真实世界参数统计特性。
  • 推导所选失真度量与分布的率失真函数,刻画压缩率与输出失真之间的理论权衡。
  • 利用逐次可 refinability 设计实用压缩算法,通过迭代剪枝实现稀疏性。
  • 提出 SuRP,一种基于最小化率失真代价的剪枝策略,仅依赖信息论准则,无需基于分数的启发式方法。
  • 通过在 CIFAR-10 和 ImageNet 上的实验验证方法,与多种基线方法对比准确率、稀疏度和比特率。

实验结果

研究问题

  • RQ1在反映输出扰动的失真度量下,神经网络压缩的根本理论极限是什么?
  • RQ2为何在最优神经网络压缩中剪枝是必要的?这一结论能否通过信息论得到证明?
  • RQ3基于率失真理论推导出的剪枝策略能否超越现有的基于分数或启发式的方法?
  • RQ4在标准基准测试中,该方法与当前最先进基线方法相比,在准确率和压缩效率方面表现如何?
  • RQ5该信息论框架能否扩展至联邦学习中神经网络梯度的压缩?

主要发现

  • 在 CIFAR-10 上,SuRP 实现了 SOTA 性能,59% 剪枝率下准确率达 90.96%,99.26% 剪枝率下准确率达 70.76%,优于所有基线方法。
  • 在 ImageNet 上,SuRP 在 80% 剪枝率下实现 75.54% 的 top-1 准确率,在 90% 剪枝率下实现 73.93%,优于 Adaptive、SNIP、DSR、SNFS 和 RiGL。
  • 该方法展现出卓越的比特率效率,将 ResNet-50 压缩至 6.1 MB(16 倍压缩),同时保持 76.4% 准确率,优于 Deep Comp. 和 DeepCABAC。
  • SuRP 在 LeNet-5 上实现 99.3% 准确率,仅需 5 KB(344 倍压缩),在准确率和压缩比上均优于 Deep Comp. 和 DNS。
  • 理论分析证实,在所定义的失真度量下,最优压缩要求使用稀疏模型,从而证明剪枝是任何高效压缩方案中不可或缺的组成部分。
  • 该方法可推广至联邦学习中的梯度压缩,为实现通信高效的模型训练提供工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。