Skip to main content
QUICK REVIEW

[论文解读] Growing Efficient Deep Networks by Structured Continuous Sparsification

Xin Yuan, Pedro Savarese|arXiv (Cornell University)|Jul 30, 2020
Multimodal Machine Learning Applications参考文献 49被引用 9
一句话总结

本文提出一种通过结构化连续稀疏化在训练过程中动态增长和剪枝深度神经网络的方法,利用可微分松弛化架构决策与随机采样,联合优化准确率与效率。在 ImageNet 上,与 ResNet-50 相比,推理阶段减少 49.7% FLOPs,训练阶段减少 47.4%,同时在无需微调的情况下保持 75.2% 的 top-1 准确率。

ABSTRACT

We develop an approach to growing deep network architectures over the course of training, driven by a principled combination of accuracy and sparsity objectives. Unlike existing pruning or architecture search techniques that operate on full-sized models or supernet architectures, our method can start from a small, simple seed architecture and dynamically grow and prune both layers and filters. By combining a continuous relaxation of discrete network structure optimization with a scheme for sampling sparse subnetworks, we produce compact, pruned networks, while also drastically reducing the computational expense of training. For example, we achieve $49.7\%$ inference FLOPs and $47.4\%$ training FLOPs savings compared to a baseline ResNet-50 on ImageNet, while maintaining $75.2\%$ top-1 accuracy -- all without any dedicated fine-tuning stage. Experiments across CIFAR, ImageNet, PASCAL VOC, and Penn Treebank, with convolutional networks for image classification and semantic segmentation, and recurrent networks for language modeling, demonstrate that we both train faster and produce more efficient networks than competing architecture pruning or search methods.

研究动机与目标

  • 通过在优化过程中动态增长和剪枝网络架构,降低训练深度网络的计算成本。
  • 消除神经架构搜索与剪枝中对大型超网络架构或训练后微调的需求。
  • 通过从最小种子架构出发并根据资源约束自适应地增长结构,提升模型效率与训练速度。
  • 通过端到端联合优化权重与架构,实现优于现有剪枝与 NAS 方法的准确率-效率权衡。
  • 通过逐步增加网络规模,实现更快、更大批量的训练,从而减少运行时间与 GPU 使用时长。

提出的方法

  • 该方法使用滤波器与层的指示变量将网络架构参数化为配置空间,实现对离散结构决策的连续松弛化。
  • 通过 Gumbel-Softmax 采样实现可微分松弛化,训练辅助掩码变量以控制架构的增长与剪枝。
  • 采用结构级温度调度策略确保稳定收敛,早期训练阶段使用高温采样,随后逐步硬化为离散决策。
  • 利用学习到的掩码参数从松弛化架构中采样稀疏子网络,实现高效训练与推理。
  • 通过随机梯度下降联合优化网络权重与架构组件,无需单独的微调阶段。
  • 该方法支持同时增长滤波器(通道维度)与整个层,实现在训练过程中对深度与宽度的动态重构。

实验结果

研究问题

  • RQ1是否可以通过在优化过程中动态增长网络架构,而非从固定的大规模架构开始,来更高效地训练深度网络?
  • RQ2如何将架构搜索与剪枝统一为一个端到端可微的训练过程?
  • RQ3通过从较小规模开始并根据准确率与稀疏度目标动态增长网络,训练成本能降低到何种程度?
  • RQ4与直接训练最终紧凑架构相比,动态架构演化是否能带来更好的泛化性或正则化效果?
  • RQ5在准确率与参数效率方面,结构化连续稀疏化相较于随机或均匀剪枝基线表现如何?

主要发现

  • 该方法在 ImageNet 上相比 ResNet-50 实现推理阶段减少 49.7% FLOPs、训练阶段减少 47.4% FLOPs,同时在无需任何微调的情况下保持 75.2% 的 top-1 准确率。
  • 在 CIFAR-10 上,该方法在 VGG-16 上仅使用 0.754M 参数即达到 92.50% 的验证准确率,优于随机剪枝基线(90.01% 准确率)与直接微调基线。
  • 对于 ResNet-20,该方法在 160 个周期后达到 92.36% 的验证准确率,超过 AutoGrow 在 360 个周期时的 84.65%,表明收敛速度更快。
  • 采用结构级温度调度策略后,该方法避免了全局温度控制导致的早期收敛问题,在 WideResNet-28-10 上将准确率下降减少至多 2.5%。
  • 与 NAS 基线相比,该方法将 GPU 搜索时长减少 45%,同时实现相当或更优的准确率-参数权衡。
  • 消融实验表明,该方法在所有预算设置下均优于均匀剪枝与随机采样基线,证明了其配置空间与增长机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。