[论文解读] Taxonomy and Evaluation of Structured Compression of Convolutional Neural Networks
本文提出了一种基于数据与计算需求的三层次结构化卷积神经网络压缩分类法,对ImageNet上的SVD、张量分解、通道剪枝和概率方法进行了评估。研究发现SVD与概率剪枝方法具有互补性,二者结合可实现最佳性能,且表明压缩预训练模型的效果优于从零开始训练小型模型。
The success of deep neural networks in many real-world applications is leading to new challenges in building more efficient architectures. One effective way of making networks more efficient is neural network compression. We provide an overview of existing neural network compression methods that can be used to make neural networks more efficient by changing the architecture of the network. First, we introduce a new way to categorize all published compression methods, based on the amount of data and compute needed to make the methods work in practice. These are three 'levels of compression solutions'. Second, we provide a taxonomy of tensor factorization based and probabilistic compression methods. Finally, we perform an extensive evaluation of different compression techniques from the literature for models trained on ImageNet. We show that SVD and probabilistic compression or pruning methods are complementary and give the best results of all the considered methods. We also provide practical ways to combine them.
研究动机与目标
- 为解决缺乏系统性框架来比较结构化神经网络压缩技术的问题。
- 评估各种压缩方法(SVD、张量分解、通道剪枝和概率方法)在大规模图像分类任务中的有效性。
- 探究压缩预训练模型是否优于从零开始训练小型模型。
- 评估在压缩比优化中使用微调前准确率作为微调后准确率代理指标的有效性。
- 为组合压缩技术以最大化性能与效率提供实用指导。
提出的方法
- 提出一种三层次压缩框架:第1层(无数据,无需微调)、第2层(数据优化,无需反向传播)、第3层(完整微调,含反向传播)。
- 评估基于SVD的方法,包括空间SVD和CP分解,用于卷积核的低秩近似。
- 应用逐层优化技术,如非对称公式和GSVD,以提高近似精度。
- 在概率压缩方法(如VIBNet、L0剪枝)中使用变分推断和L0正则化,以实现结构化稀疏性。
- 基于奇异值设计贪婪秩选择策略,用于初始压缩比分配。
- 通过对比50个扰动压缩模型的微调前与微调后准确率,验证代理准确率假设。
实验结果
研究问题
- RQ1在提出的三个压缩层次中,不同结构化压缩方法在准确率与效率方面如何比较?
- RQ2在压缩比优化中,微调前准确率是否可作为微调后准确率的可靠代理?
- RQ3在不同压缩比下,SVD、张量分解、剪枝或概率方法中哪种技术表现最佳?
- RQ4结合SVD与概率剪枝方法是否能带来优于单一技术的性能?
- RQ5压缩大型预训练模型是否优于从零开始训练小型模型,从而支持彩票券假说?
主要发现
- 基于SVD的压缩,特别是结合GSVD优化的空间SVD,在第1层和第3层中表现优于其他方法,尤其在高阶压缩比下表现更优。
- 概率方法(如VIBNet和L0剪枝)在第3层中于中等压缩比下取得最佳结果,且保持了较高的准确率。
- 微调前与微调后准确率之间无显著相关性,表明通常假设微调前准确率可作为优化代理是无效的。
- 将VIBNet与空间SVD结合可在所有模型与压缩层级中实现最佳整体性能,证明了其互补性。
- 对更大规模预训练模型(如ResNet-18)进行第3层压缩,其准确率优于从零开始训练小型模型,支持彩票券假说。
- 所提出的三层次分类法能有效根据实际需求区分压缩方法,实现更清晰的比较与选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。