Skip to main content
QUICK REVIEW

[论文解读] Sparse Flows: Pruning Continuous-depth Models

Lucas Liebenwein, Ramin Hasani|arXiv (Cornell University)|Jun 24, 2021
Model Reduction and Neural Networks参考文献 64被引用 4
一句话总结

本文提出Sparse Flows,一种针对连续深度模型(如神经ODE和连续归一化流,CNFs)的剪枝框架,表明结构化与非结构化剪枝可提升泛化性能,减少模式崩溃,并在不损失准确率的前提下实现高达98%的参数压缩。该方法揭示剪枝可使损失曲面变平,提升密度估计任务中的鲁棒性。

ABSTRACT

Continuous deep learning architectures enable learning of flexible probabilistic models for predictive modeling as neural ordinary differential equations (ODEs), and for generative modeling as continuous normalizing flows. In this work, we design a framework to decipher the internal dynamics of these continuous depth models by pruning their network architectures. Our empirical results suggest that pruning improves generalization for neural ODEs in generative modeling. We empirically show that the improvement is because pruning helps avoid mode-collapse and flatten the loss surface. Moreover, pruning finds efficient neural ODE representations with up to 98% less parameters compared to the original network, without loss of accuracy. We hope our results will invigorate further research into the performance-size trade-offs of modern continuous-depth models.

研究动机与目标

  • 研究剪枝如何影响神经ODE和CNFs等连续深度模型的内部动态与泛化性能。
  • 理解剪枝是否可通过改变损失曲面结构、避免模式崩溃来提升密度估计任务中的泛化性能。
  • 通过剪枝识别最小化、高效的神经ODE架构,同时保持或提升性能。
  • 探究架构稀疏性对连续归一化流中Hessian特征值与损失曲面平坦度的影响。
  • 通过系统性消融实验,为构建鲁棒、稀疏且高效的连续深度模型提供设计洞见。

提出的方法

  • 对神经ODE和CNFs中的神经网络组件应用结构化与非结构化剪枝技术,以减少模型参数量。
  • 采用基于Hessian的分析方法,通过计算剪枝后模型的Hessian矩阵特征值来评估损失曲面的平坦度。
  • 使用基于ODE的流的变量变换公式计算密度估计中的对数似然,保持可逆性并实现雅可比行列式行列的可计算性。
  • 实现FFJORD作为CNF的快速变体,以在玩具数据集和真实世界数据集上实现可扩展的训练与剪枝实验。
  • 对激活函数、宽度、深度及超参数(学习率、权重衰减)进行消融研究,以识别稀疏神经ODE的最优设计选择。
  • 通过在特征值分析前将对应剪枝权重的Hessian条目置零,确保稀疏Hessian的计算,以保持损失曲面评估的准确性。

实验结果

研究问题

  • RQ1剪枝是否能提升神经ODE和CNFs等连续深度模型在密度估计任务中的泛化性能?
  • RQ2剪枝如何影响损失曲面的几何结构,特别是Hessian特征值与损失平坦度?
  • RQ3剪枝能否通过提升模型捕捉所有数据模式的能力,来缓解多模态密度估计中的模式崩溃?
  • RQ4在不牺牲性能的前提下,神经ODE可实现的最大参数压缩比是多少?此类稀疏模型能否从零开始训练?
  • RQ5在剪枝后的神经ODE中,哪些架构与超参数选择(如激活函数、宽度、深度、学习率)对泛化性能最为关键?

主要发现

  • 在最优稀疏度水平下,剪枝可显著提升神经ODE在密度估计中的泛化性能,经验风险最高可降低一个数量级。
  • 剪枝通过减小Hessian特征值的幅值使损失曲面变平,与平坦极小值与更好泛化性能之间的理论联系一致。
  • 在剪枝模型中,多模态密度估计的模式崩溃显著减少或完全消除,这由提升的对数似然和样本质量所证实。
  • 该框架在神经ODE中实现了高达98%的参数压缩(50倍压缩),同时在CIFAR-10及其他基准测试中保持或提升了测试准确率。
  • 从零开始训练稀疏神经ODE无法有效实现;剪枝对于发现高效且高性能的架构至关重要。
  • Lipschitz连续、单调且有界的激活函数在剪枝后的神经ODE中表现更优,且在稀疏设置下,模型宽度比深度对泛化性能的影响更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。