Skip to main content
QUICK REVIEW

[论文解读] Dual Dynamic Inference: Enabling More Efficient, Adaptive and Controllable Deep Inference

Yue Wang, Jianghao Shen|arXiv (Cornell University)|Jul 10, 2019
Advanced Neural Network Applications参考文献 46被引用 9
一句话总结

本文提出双动态推理(Dual Dynamic Inference, DDI),一种统一框架,结合输入相关与资源相关动态推理,实现高效、自适应且可控的深度学习推理。通过引入多粒度学习跳过(Multi-grained Learning-to-Skip, MGL2S)策略,实现逐层与逐通道同时跳过,DDI 在 CIFAR-10 和 ImageNet 上实现高达 4× 的计算量节省,且准确率与最先进基线相当或更高,同时在硬性资源约束下支持任意时间预测。

ABSTRACT

State-of-the-art convolutional neural networks (CNNs) yield record-breaking predictive performance, yet at the cost of high-energy-consumption inference, that prohibits their widely deployments in resource-constrained Internet of Things (IoT) applications. We propose a dual dynamic inference (DDI) framework that highlights the following aspects: 1) we integrate both input-dependent and resource-dependent dynamic inference mechanisms under a unified framework in order to fit the varying IoT resource requirements in practice. DDI is able to both constantly suppress unnecessary costs for easy samples, and to halt inference for all samples to meet hard resource constraints enforced; 2) we propose a flexible multi-grained learning to skip (MGL2S) approach for input-dependent inference which allows simultaneous layer-wise and channel-wise skipping; 3) we extend DDI to complex CNN backbones such as DenseNet and show that DDI can be applied towards optimizing any specific resource goals including inference latency or energy cost. Extensive experiments demonstrate the superior inference accuracy-resource trade-off achieved by DDI, as well as the flexibility to control such trade-offs compared to existing peer methods. Specifically, DDI can achieve up to 4 times computational savings with the same or even higher accuracy as compared to existing competitive baselines.

研究动机与目标

  • 解决由于高能耗与高计算成本,导致在资源受限的物联网设备中部署高复杂度卷积神经网络(CNN)的挑战。
  • 在一个统一框架中整合输入相关动态推理(根据样本难度自适应)与资源相关动态推理(满足硬性资源限制)。
  • 克服现有动态推理方法的局限性,这些方法仅支持粗粒度的层跳过,或受限于简单网络结构(如 ResNet)。
  • 通过同时实现层粒度与通道粒度的跳过,实现对准确率-计算量权衡的细粒度、灵活控制。
  • 将动态推理扩展至复杂 CNN 主干网络(如 DenseNet),展示其通用性与效率提升。

提出的方法

  • 提出双动态推理(DDI)框架,在统一架构下集成输入相关与资源相关动态机制。
  • 提出多粒度学习跳过(MGL2S)方法,支持同时进行层粒度与通道粒度的跳过,提升灵活性与准确率-资源平衡。
  • 设计针对复杂主干网络(如 DenseNet)量身定制的新门控机制与跳过策略,确保兼容性与性能。
  • 采用可微分损失函数端到端训练 DDI 模型,鼓励根据输入难度与资源约束实现早期退出与高效跳过。
  • 通过在推理时动态调整推理深度与宽度,支持任意时间预测,实现实时适应不同计算预算。
  • 将该框架应用于 ResNet 与 DenseNet,证明在多种架构与数据集上均保持一致的性能提升。

实验结果

研究问题

  • RQ1统一框架能否有效结合输入相关与资源相关动态推理,从而提升边缘人工智能的能效?
  • RQ2与现有粗粒度跳过方法相比,多粒度跳过(同时实现层与通道跳过)在提升准确率-计算量权衡方面能达到何种程度?
  • RQ3DDI 框架在具有密集连接与更高模型复杂度的复杂 CNN 架构(如 DenseNet)上,泛化能力如何?
  • RQ4与最先进动态推理基线(如 SkipNet)相比,DDI 是否能在保持或提升准确率的同时实现显著的计算量节省?
  • RQ5在固定延迟或能效预算等硬性资源约束下,DDI 支持任意时间预测的效率如何?

主要发现

  • 在 CIFAR-10 上,DDI 实现高达 4× 的计算量节省,且准确率与最佳对比基线 SkipNet 相当或更高。
  • 在 ImageNet 上,DenseNet201-DDI 模型在相同 FLOP 预算下,Top-1 准确率比基线模型高出最多 9%,证明其优越的准确率-资源权衡能力。
  • MGL2S 方法实现了灵活的多粒度跳过,通过精细控制跳过的通道与层,有效降低了准确率损失。
  • 特征可视化显示,通道跳过相比层跳过导致的特征退化更小,验证了其在计算约束下实现更平滑准确率下降的合理性。
  • DDI 学习到的跳过模式始终保留每个阶段的第一残差块,表明其学习到了结构上的重要性与鲁棒性。
  • DDI 在硬性计算预算下成功实现了任意时间预测,在多个 FLOP 水平下均保持与基线模型相当或更优的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。