Skip to main content
QUICK REVIEW

[论文解读] Improved Bayesian Compression

Marco Federici, Karen Ullrich|arXiv (Cornell University)|Nov 17, 2017
Anomaly Detection Techniques and Applications参考文献 3被引用 12
一句话总结

该论文提出了一种联合贝叶斯压缩方法,结合变分dropout实现结构化稀疏性与软权重重用实现量化,通过在权值及其均值上施加分层先验,联合优化权值中心与稀疏性,实现了最先进的压缩比——在LeNet5上最高达482倍,且精度损失极小。

ABSTRACT

Compression of Neural Networks (NN) has become a highly studied topic in recent years. The main reason for this is the demand for industrial scale usage of NNs such as deploying them on mobile devices, storing them efficiently, transmitting them via band-limited channels and most importantly doing inference at scale. In this work, we propose to join the Soft-Weight Sharing and Variational Dropout approaches that show strong results to define a new state-of-the-art in terms of model compression.

研究动机与目标

  • 解决现有贝叶斯压缩方法的局限性:这些方法要么剪枝权值(变分dropout),要么量化权值(软权重重用),但无法同时实现两者。
  • 通过在权值及其中心上施加分层先验,联合诱导稀疏性并实现高效量化,从而提升模型压缩效果。
  • 在统一的变分推断框架内整合两种互补的压缩机制,实现更高压缩比而不损失模型精度。
  • 通过在推理阶段的后训练流水线中结合剪枝、聚类与熵编码,实现压缩模型在资源受限设备上的实际部署。

提出的方法

  • 使用因子化解析后验 $ q_{\boldsymbol{\phi}}(\mathbf{w}, \mathbf{m}) = \prod_i q_{\sigma_i}(w_i|m_i) q_{\theta_i}(m_i) $ 建模权值 $\mathbf{w}$ 及其中心 $\mathbf{m}$ 的后验分布,其中 $ w_i $ 以 $ m_i $ 为中心呈高斯分布,且 $ m_i $ 为狄拉克峰。
  • 采用重尾的对数均匀先验 $ p(w_i) \propto 1/|w_i| $ 以诱导权值稀疏性,并在中心上施加高斯混合模型(GMM)先验 $ p_\psi(m_i) $ 以支持聚类与量化。
  • 构建变分下界 $ \mathcal{L}(\boldsymbol{\phi}, \boldsymbol{\psi}) = L_\mathcal{D}(\boldsymbol{\phi}) - D_{KL}(q_{\boldsymbol{\phi}}||p_{\boldsymbol{\psi}}) $,并将KL散度分解为权值特异与中心特异两部分。
  • 采用Molchanov等人(2017)提出的技术近似高斯后验与重尾先验之间的KL散度,确保训练稳定性。
  • 应用后训练压缩流水线:(1) 通过学习到的GMM对权值中心进行聚类,(2) 剪枝零行/列,(3) 使用压缩稀疏行(CSR)格式编码,(4) 对非零权值应用霍夫曼编码。
  • 固定一个GMM分量为零,以强制实现稀疏性,从而支持高效剪枝与编码。

实验结果

研究问题

  • RQ1在单一贝叶斯框架中联合使用变分dropout与软权重重用,是否能实现比单独使用任一方法更高的压缩比?
  • RQ2通过在分层先验下联合优化权值中心与稀疏性,是否能在不降低精度的前提下提升模型压缩效果?
  • RQ3所提方法在标准视觉基准测试上,能在多大程度上实现高倍压缩比并保持模型性能?
  • RQ4在后训练压缩流水线中,GMM聚类与霍夫曼编码的集成对最终压缩效率有何影响?

主要发现

  • 该方法在LeNet5上实现了482倍的压缩比,测试精度仅比原始模型下降0.05%。
  • 在LeNet300-100上,该方法实现了161倍的压缩比,测试精度达98.24%,优于变分dropout(131倍)与软权重重用(34倍)。
  • 在将非零权值减少至总量0.5%的同时,仍保持99.14%的高精度,表明其具有强大的稀疏性诱导能力。
  • GMM聚类与霍夫曼编码的联合使用,将每个非零权值的平均位宽降低至 $ k \leq \log K + 1 $,显著提升了存储效率。
  • 在全连接与卷积架构上,该方法在压缩比方面全面超越基线方法(L2、SWS、VD),确立了新的SOTA水平。
  • 后训练流水线有效保持了模型性能,因为聚类与剪枝步骤在训练过程中受到学习到的后验结构的引导。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。