[论文解读] Fractional Skipping: Towards Finer-Grained Dynamic CNN Inference
本文提出动态分数量化跳过(DFS),一种将输入自适应的层跳过与量化统一的框架,通过将逐层位宽分配视为介于完整执行与完全跳过之间的中间‘分数’执行选项。DFS 通过基于输入的动态权重与激活位宽分配,实现更细粒度的精度-计算权衡,相较于二值跳过和静态量化方法,性能更优。
While increasingly deep networks are still in general desired for achieving state-of-the-art performance, for many specific inputs a simpler network might already suffice. Existing works exploited this observation by learning to skip convolutional layers in an input-dependent manner. However, we argue their binary decision scheme, i.e., either fully executing or completely bypassing one layer for a specific input, can be enhanced by introducing finer-grained, "softer" decisions. We therefore propose a Dynamic Fractional Skipping (DFS) framework. The core idea of DFS is to hypothesize layer-wise quantization (to different bitwidths) as intermediate "soft" choices to be made between fully utilizing and skipping a layer. For each input, DFS dynamically assigns a bitwidth to both weights and activations of each layer, where fully executing and skipping could be viewed as two "extremes" (i.e., full bitwidth and zero bitwidth). In this way, DFS can "fractionally" exploit a layer's expressive power during input-adaptive inference, enabling finer-grained accuracy-computational cost trade-offs. It presents a unified view to link input-adaptive layer skipping and input-adaptive hybrid quantization. Extensive experimental results demonstrate the superior tradeoff between computational cost and model expressive power (accuracy) achieved by DFS. More visualizations also indicate a smooth and consistent transition in the DFS behaviors, especially the learned choices between layer skipping and different quantizations when the total computational budgets vary, validating our hypothesis that layer quantization could be viewed as intermediate variants of layer skipping. Our source code and supplementary material are available at \link{https://github.com/Torment123/DFS}.
研究动机与目标
- 为解决二值层跳过带来的低效问题,该方法将每层视为完全执行或完全跳过,导致精度与计算成本之间的粗粒度权衡。
- 探索层量化是否可作为全执行与完全跳过之间的‘分数’中间状态,从而实现更平滑、更灵活的模型自适应。
- 开发一个统一框架,根据输入动态分配权重与激活的位宽,从而实现对计算复杂度与模型表达能力的更细粒度控制。
- 通过实证验证,量化在动态推理流水线中是否自然地充当软中间选项,实现跳过、量化与全执行之间的平滑过渡。
提出的方法
- DFS 将逐层量化(至不同位宽)视为介于全执行(全精度位宽)与跳过(零位宽)之间的中间‘软’决策,从而实现分数跳过。
- 该框架采用两步训练过程,学习各层权重与激活的输入自适应位宽分配,以在计算约束下优化精度。
- 引入可微分的决策机制,使模型能够根据输入特征,动态选择每层的跳过、8位、4位或全精度执行。
- 该方法将动态推理与量化整合到单一统一的优化目标中,支持端到端的梯度优化训练。
- 使用计算百分比(cp)预算作为调节控制旋钮,以调节总推理成本,随着 cp 增加,决策实现平滑演化。
- 在不同 cp 水平下,对层级决策分布的可视化显示,从跳过到量化再到全执行的过渡始终一致且平滑。
实验结果
研究问题
- RQ1在动态卷积神经网络推理中,层量化是否可被有意义地解释为介于全层执行与完全跳过之间的‘分数’中间状态?
- RQ2在各层中采用输入自适应的动态位宽分配,是否能带来优于二值层跳过或固定量化方法的精度-计算权衡?
- RQ3随着计算预算的增加,DFS 学习到的决策行为如何平滑演化?是否支持量化作为软跳过变体的假设?
- RQ4在不同计算约束下,DFS 在精度方面相较于现有最先进方法的性能优势有多大?
主要发现
- DFS 在仅使用原始计算预算 6.25% 的情况下,于 CIFAR-10 上实现了 93.54% 的 top-1 精度,展现出卓越的效率-精度权衡。
- 当计算百分比从 4% 增加到 6.25% 时,DFS 的精度从 92.91% 提升至 93.54%,表明通过量化实现的更细粒度控制带来了显著收益。
- 可视化结果表明,随着 cp 增加,决策从层跳过平滑过渡至 8 位量化,最终进入全执行,支持量化作为软中间状态的假设。
- 每个残差块中的首个残差块始终被选择(从不跳过),与已知的架构重要性一致,验证了模型学习到的决策逻辑。
- DFS 在多个基准测试中均优于二值层跳过与静态量化基线,尤其在低计算场景下表现更优。
- 模型在不同位宽下表现出一致行为,8 位量化在中等计算设置下占主导地位,表明其作为关键中间选项的重要作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。