Skip to main content
QUICK REVIEW

[论文解读] Fast and Energy-Efficient CNN Inference on IoT Devices

Mohammad Motamedi, Daniel Fong|arXiv (Cornell University)|Nov 22, 2016
Advanced Neural Network Applications参考文献 7被引用 9
一句话总结

本文提出了一种基于RenderScript的并行化技术,用于在移动GPU上实现快速且节能的CNN推理,针对设备特定硬件进行优化,并采用混合精度计算。与串行执行相比,该方法实现了最高310.74倍的加速比,能耗降低高达249.47倍,使三种不同移动平台的每张图像能耗低于0.6焦耳,从而实现真正的实时设备端推理。

ABSTRACT

Convolutional Neural Networks (CNNs) exhibit remarkable performance in various machine learning tasks. As sensor-equipped internet of things (IoT) devices permeate into every aspect of modern life, it is increasingly important to run CNN inference, a computationally intensive application, on resource constrained devices. We present a technique for fast and energy-efficient CNN inference on mobile SoC platforms, which are projected to be a major player in the IoT space. We propose techniques for efficient parallelization of CNN inference targeting mobile GPUs, and explore the underlying tradeoffs. Experiments with running Squeezenet on three different mobile devices confirm the effectiveness of our approach. For further study, please refer to the project repository available on our GitHub page: https://github.com/mtmd/Mobile_ConvNet

研究动机与目标

  • 实现资源受限的物联网和移动设备上的实时、节能CNN推理。
  • 解决基于云的推理的局限性,包括高能耗、依赖网络连接以及隐私问题。
  • 通过利用RenderScript实现异构计算,优化移动GPU上的CNN推理性能。
  • 识别适用于设备和层特定的最优并行化与精度设置参数。
  • 证明在设备端实现SqueezeNet推理的可行性,延迟低于250ms且能耗低于0.6J。

提出的方法

  • 利用Android的RenderScript框架,将CNN计算分布在移动SoC的CPU和GPU核心上。
  • 实现线程级并行化策略,其中每个输出特征图元素由独立线程计算。
  • 采用带步长控制的3D卷积核,高效处理输入特征图和滤波器组。
  • 应用混合精度计算(单精度和半精度),以减少计算负载和内存带宽。
  • 通过设备特定调优,为每个平台和CNN层选择最优的块大小、线程数和精度模式。
  • 使用Trepn分析器在真实环境下实现自动化、精确的功耗和能耗测量。

实验结果

研究问题

  • RQ1如何在最小化能耗的前提下加速移动GPU上的CNN推理?
  • RQ2不同移动GPU架构下,并行化与精度设置的最优权衡是什么?
  • RQ3混合精度计算是否能在显著提升移动设备性能的同时保持精度?
  • RQ4在多种移动平台上,并行推理的能效与串行执行相比如何?
  • RQ5在物联网设备上,设备端CNN推理在多大程度上可实现用于实时应用?

主要发现

  • 所提出的并行算法在三台移动设备上相对于串行实现的最小加速比为59.54X,最大达到310.74X。
  • 能耗最高降低249.47倍,各平台每张图像的总能耗范围为0.106J至0.569J。
  • 设备端推理是可行的,执行时间低于250ms(Nexus 6P为129.21ms),能耗低于0.6J,支持实时应用。
  • 与精确(单精度)并行执行相比,不精确(半精度)计算将执行时间减少2.11至4.16倍。
  • Nexus 5在并行模式下功耗更低,因其GPU时钟频率较低且芯片组架构更旧但更高效。
  • 最优设计参数(包括块大小和精度)在不同平台和CNN层之间差异显著,因此需要进行设备特定调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。