[论文解读] Stochastic Downsampling for Cost-Adjustable Inference and Improved Regularization in Convolutional Networks
本文提出Stochastic Downsampling Point(SDPoint),一种通过在训练过程中随机在不同层和下采样比例下应用下采样,实现可调节推理成本并改进正则化的卷积网络训练方法。SDPoint使单一模型能够支持多种推理成本,同时在不同配置间共享参数,从而在比现有方法更低的FLOP预算下实现更好的泛化性能和最先进(SOTA)的准确率。
It is desirable to train convolutional networks (CNNs) to run more efficiently during inference. In many cases however, the computational budget that the system has for inference cannot be known beforehand during training, or the inference budget is dependent on the changing real-time resource availability. Thus, it is inadequate to train just inference-efficient CNNs, whose inference costs are not adjustable and cannot adapt to varied inference budgets. We propose a novel approach for cost-adjustable inference in CNNs - Stochastic Downsampling Point (SDPoint). During training, SDPoint applies feature map downsampling to a random point in the layer hierarchy, with a random downsampling ratio. The different stochastic downsampling configurations known as SDPoint instances (of the same model) have computational costs different from each other, while being trained to minimize the same prediction loss. Sharing network parameters across different instances provides significant regularization boost. During inference, one may handpick a SDPoint instance that best fits the inference budget. The effectiveness of SDPoint, as both a cost-adjustable inference approach and a regularizer, is validated through extensive experiments on image classification.
研究动机与目标
- 为解决在实时资源受限系统中,训练能够适应不同推理预算的CNN模型的挑战。
- 开发一种方法,使单一模型无需重新训练即可支持多种推理成本。
- 通过在训练过程中跨多样化下采样配置共享参数,改进模型正则化。
- 在低成本推理中充分利用网络参数,与跳过层或参数的方法不同。
提出的方法
- 在训练过程中,每次迭代随机选择一个SDPoint实例,其由下采样层索引和下采样比例定义,用于减小特征图的空间尺寸。
- 下采样应用于中间特征图,降低计算成本(FLOPs),同时保持所有实例间共享的网络权重。
- 所有SDPoint实例均通过最小化相同的预测损失进行训练,从而实现参数共享,提升正则化效果。
- 在推理阶段,根据可用的计算预算,确定性地选择一个特定的SDPoint实例。
- 该方法与网络架构无关,且不增加额外参数或训练开销。
- 该方法利用下采样点和比例的随机性,提升模型的尺度不变性和鲁棒性。
实验结果
研究问题
- RQ1是否可以通过随机下采样,在不重新训练的情况下,使单一CNN支持多种推理成本?
- RQ2在多样化下采样配置间共享参数如何改善模型正则化和泛化能力?
- RQ3与跳过网络层相比,对中间特征图进行下采样是否能保留更多有用信息,从而在低成本推理中表现更优?
- RQ4与基线模型相比,SDPoint在多大程度上提升了CNN的尺度敏感性?
- RQ5SDPoint是否能在显著低于现有方法的FLOP成本下,实现最先进(SOTA)的准确率?
主要发现
- SDPoint将ResNeXt-d101-c32的top-1验证误差降低至20.4%,top-5误差降低至5.3%,在FLOP数量约为两倍于SOTA模型的情况下达到相同性能。
- PreResNet-d101的一个SDPoint实例在仅69%的FLOPs下,实现了与SACT相当的准确率,证明了其在成本-准确率效率上的优越性。
- SDPoint增强的模型在不同预裁剪尺寸下的平均成对余弦相似度达到0.961,优于基线模型的0.944,表明其尺度不变性得到改善。
- 若移除0.5下采样比例或使用交替块,性能下降,证实随机性对正则化的关键作用。
- 需要更高FLOPs(如16.0 GFLOPs)的困难ImageNet样本通常包含以尺寸为主导的干扰物体,表明早期下采样会损害此类样本的准确性。
- SDPoint可识别出在成本与准确率之间达到最优权衡的子网络,并可根据所需推理成本对样本按分类难度进行排序。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。