[论文解读] Mobile Machine Learning Hardware at ARM: A Systems-on-Chip (SoC) Perspective
本文提出一种面向移动端机器学习的系统级协同设计方法,通过重用图像信号处理(ISP)模块生成的运动矢量以及ARM的加速器一致性端口(ACP)访问L3缓存,降低连续计算机视觉任务中卷积神经网络(CNN)的推理频率。通过复用运动数据实现目标追踪,而非每帧执行完整推理,该方法在精度损失低于1%的情况下实现了超过40%的能效降低。
Machine learning is playing an increasingly significant role in emerging mobile application domains such as AR/VR, ADAS, etc. Accordingly, hardware architects have designed customized hardware for machine learning algorithms, especially neural networks, to improve compute efficiency. However, machine learning is typically just one processing stage in complex end-to-end applications, involving multiple components in a mobile Systems-on-a-chip (SoC). Focusing only on ML accelerators loses bigger optimization opportunity at the system (SoC) level. This paper argues that hardware architects should expand the optimization scope to the entire SoC. We demonstrate one particular case-study in the domain of continuous computer vision where camera sensor, image signal processor (ISP), memory, and NN accelerator are synergistically co-designed to achieve optimal system-level efficiency.
研究动机与目标
- 应对移动系统中设备端深度学习日益增长的计算与能耗需求。
- 通过扩展至完整片上系统(SoC)协同设计,突破孤立DNN加速器优化的局限。
- 在不牺牲精度的前提下,降低连续计算机视觉工作负载的能耗。
- 通过抽象层与标准化API,实现高效的软硬件协同集成。
- 证明ISP、内存与加速器之间的跨IP协同可带来显著的系统级性能提升。
提出的方法
- 利用ISP时域去噪流水线生成的运动矢量(MVs)实现目标追踪,避免每帧重复执行CNN推理。
- 通过ARM的加速器一致性端口(ACP)实现对L3缓存的直接访问,支持层间数据复用,减少DRAM访问流量。
- 引入系统级外推窗口(EW),在运动矢量足以支持追踪的帧上跳过CNN推理。
- 使用ARM Compute Library实现优化的DNN内核,并通过AndroidNN API与HAL抽象层暴露接口。
- 基于Jetson TX2的实测数据校准自定义SoC仿真器,以评估能效与精度之间的权衡。
- 通过保留AndroidNN接口并仅修改底层驱动与HAL,确保向后兼容性。
实验结果
研究问题
- RQ1在移动端连续视觉任务中,通过ISP、内存与NN加速器的系统级协同设计,是否能有效降低能耗且不造成显著精度损失?
- RQ2ISP生成的运动矢量在多大程度上可被复用于目标追踪,从而减少对重复CNN推理的需求?
- RQ3通过ACP实现的L3缓存共享,在CNN工作负载中对减少DRAM带宽与能耗的效率如何?
- RQ4当外推窗口尺寸增大时,能效节省与精度损失之间的权衡关系如何?
- RQ5通过硬件-软件栈抽象是否能保持应用兼容性,同时支持新的系统级优化?
主要发现
- 所提系统在1080p/60fps实时目标检测任务中,能耗降低超过40%。
- 当外推窗口大小为2时,系统精度损失低于1%,相比全帧推理表现优异。
- 随着外推窗口增大,能耗节省持续提升,但精度随窗口增长呈渐进式下降。
- 该方法优于模型压缩技术(如TinyYOLO),在保持更高精度的同时实现更大的能效节省。
- 通过ACP实现的L3缓存复用显著减少了DRAM访问,通过最小化片外内存流量,有效提升了整体能效。
- 通过抽象层与HAL修改,系统保持了与现有基于AndroidNN应用的完全向后兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。