[论文解读] Learning Strict Identity Mappings in Deep Residual Networks
本文提出 $ε$-ResNet,一种通过在残差响应低于阈值 $ε$ 时强制执行严格恒等映射,自动剪枝深层残差网络中冗余残差块的方法。通过引入少量额外的 ReLU 单元,该方法可在训练过程中实现无性能损失的层剪枝,在 CIFAR 和 SVHN 数据集上实现高达 80% 的参数减少,在 ImageNet 上实现 36% 的剪枝率,且精度损失极小。
A family of super deep networks, referred to as residual networks or ResNet, achieved record-beating performance in various visual tasks such as image recognition, object detection, and semantic segmentation. The ability to train very deep networks naturally pushed the researchers to use enormous resources to achieve the best performance. Consequently, in many applications super deep residual networks were employed for just a marginal improvement in performance. In this paper, we propose epsilon-ResNet that allows us to automatically discard redundant layers, which produces responses that are smaller than a threshold epsilon, with a marginal or no loss in performance. The epsilon-ResNet architecture can be achieved using a few additional rectified linear units in the original ResNet. Our method does not use any additional variables nor numerous trials like other hyper-parameter optimization techniques. The layer selection is achieved using a single training process and the evaluation is performed on CIFAR-10, CIFAR-100, SVHN, and ImageNet datasets. In some instances, we achieve about 80% reduction in the number of parameters.
研究动机与目标
- 解决超深残差网络因计算成本高昂而性能增益微小的低效问题。
- 开发一种可自动识别并移除残差网络中冗余层的方法,无需微调或重新训练。
- 通过动态剪枝输出低于阈值 $\\epsilon$ 的残差块,实现在残差网络中强制执行严格恒等映射。
- 在多个基准数据集上实现显著的模型压缩,同时保持或仅有极小的性能退化。
提出的方法
- 引入一个稀疏化函数 $\\mathcal{S}(\\mathcal{F}(x))$,当所有响应值均低于 $\\epsilon$ 时,将残差输出设为零;否则,原样传递 $\\mathcal{F}(x)$。
- 在标准残差块中增加额外的 ReLU 单元以实现稀疏化函数,从而支持端到端训练与自动层剪枝。
- 采用单一训练流程,结合自适应学习率调度策略,在每次剪枝后重置学习率,以稳定优化过程。
- 在网络中间层引入辅助监督,系数为 0.1,以促进权重衰减并提升剪枝稳定性。
- 在所有数据集中采用标准数据增强方法,以及带有批量归一化、权重衰减和动量的 SGD。
- 在 CIFAR-10、CIFAR-100、SVHN 和 ImageNet 上进行训练,采用修改后的学习率调度策略,在每次剪枝后加速衰减。
实验结果
研究问题
- RQ1深层残差网络中的冗余残差块能否在几乎不损失性能的情况下被自动识别并剪枝?
- RQ2通过对残差响应施加阈值 $\\epsilon$ 的严格恒等映射,是否能实现高效且稳定的模型压缩?
- RQ3剪枝过程能否在单次训练中完成,而无需额外的超参数调优或多次重新训练?
- RQ4剪枝层在模型深度上的分布如何?剪枝是否更倾向于深层网络?
- RQ5在保持标准视觉基准任务上竞争力精度的前提下,模型大小最多可压缩到何种程度?
主要发现
- 在 CIFAR-100 上,$\\epsilon$-ResNet 实现了 3.2 倍的压缩比(从 752 层减少至约 235 层),验证误差从 24.8% 降至 23.8%。
- 在 CIFAR-10、CIFAR-100 和 SVHN 上,$\\epsilon$-ResNet 实现了高达 80% 的参数减少,且与原始 ResNet 相比无性能损失。
- 在 ImageNet 上,101 层和 152 层的 $\\epsilon$-ResNet 实现了 20.12% 至 36.23% 的层剪枝,仅造成微小的精度损失。
- 严格恒等映射的比例在训练过程中逐渐增加,并稳定在与完整网络性能相当的水平。
- 剪枝在深层网络中更为激进,更多模块在输出附近被移除,表明剪枝更倾向于移除较不关键的组件。
- 辅助监督改善了权重衰减与剪枝稳定性,但 $\\epsilon$-ResNet 仍以无性能损失实现了比标准 ResNet 更高的压缩效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。