Skip to main content
QUICK REVIEW

[论文解读] Rethinking Machine Learning Development and Deployment for Edge Devices

Liangzhen Lai, Naveen Suda|arXiv (Cornell University)|Jun 20, 2018
IoT and Edge/Fog Computing参考文献 18被引用 9
一句话总结

本文提出了一种针对边缘设备(特别是ARM Cortex-M CPU)优化的新机器学习开发与部署流水线,通过一种名为KANI的专用框架重新思考模型训练与推理。通过直接以8位整数量化格式训练模型并使用自定义算子,该方法消除了部署不匹配问题,将模型大小减少高达75%,同时在准确率上与FP32模型相当或更优,从而实现在资源受限硬件上的高效、高质量推理。

ABSTRACT

Machine learning (ML), especially deep learning is made possible by the availability of big data, enormous compute power and, often overlooked, development tools or frameworks. As the algorithms become mature and efficient, more and more ML inference is moving out of datacenters/cloud and deployed on edge devices. This model deployment process can be challenging as the deployment environment and requirements can be substantially different from those during model development. In this paper, we propose a new ML development and deployment approach that is specially designed and optimized for inference-only deployment on edge devices. We build a prototype and demonstrate that this approach can address all the deployment challenges and result in more efficient and high-quality solutions.

研究动机与目标

  • 为解决在资源受限的边缘设备上部署机器学习模型时,传统框架导致的部署不匹配问题。
  • 通过在单一、优化的流水线中统一训练与部署,缩小高级框架中的模型开发与边缘硬件高效推理之间的差距。
  • 通过端到端地在低精度整数格式(如8位非对称/对称量化)中进行训练与部署,提升模型效率与质量,而无需依赖训练后量化。
  • 消除由机器学习框架与推理引擎之间算子可用性及行为差异导致的部署瓶颈。
  • 证明直接在低精度格式中训练的模型,与FP32模型相比,可获得相当或更优的准确率,尤其在结合适当的预处理与优化时。

提出的方法

  • 提出一种新的机器学习开发与部署流水线,其中模型训练与部署统一于一个原生支持8位整数运算和自定义量化算子的单一框架(KANI)中。
  • 引入一种新颖的训练流程,从一开始就使用量化运算直接优化8位推理,避免了训练后量化的需求。
  • 采用自定义算子实现栈(如CMSIS-NN),支持如Winograd卷积和量化矩阵乘法等专用低精度运算。
  • 使用统一的模型表示形式,可直接从训练图映射到部署推理图,消除了中间转换步骤并保留了模型行为。
  • 应用输入预处理技术,如逐图像标准化和类似批量归一化的归一化,以提升量化模型的准确率。
  • 采用混合训练策略,允许在FP32中预训练的模型在KANI框架中重新定位并微调,以在量化后恢复准确率。

实验结果

研究问题

  • RQ1在边缘设备上部署时,直接以8位整数格式训练深度神经网络,是否能获得与FP32模型相当或更优的准确率?
  • RQ2统一的训练与部署流水线在多大程度上能降低部署复杂性,并消除框架与推理环境之间的不匹配?
  • RQ3不同输入预处理技术对低精度推理中量化模型准确率的影响如何?
  • RQ4在8位整数格式中训练时,优化器选择与学习率对收敛性和最终准确率的影响是什么?
  • RQ5预训练的FP32模型是否能在所提出的流水线中有效重定向并微调,以实现高准确率且重训练成本极低?

主要发现

  • 在CIFAR-10上,直接以8位整数格式(KANI)训练达到81.9%的top-1准确率,与采用不同预处理技术的FP32模型(81.5–81.8%)相当或更优。
  • 与FP32模型相比,KANI框架将模型大小减少了高达75%,同时保持或提升了准确率,展现出显著的效率优势。
  • 在KANI中使用类似批量归一化的预处理技术,使准确率达到81.9%,优于标准的逐图像归一化和binaryproto-based预处理方法。
  • KANI中的训练每步比FP32训练慢20–25%,但通过提高初始学习率可改善收敛性,表明训练速度与优化之间存在权衡。
  • 采用预训练FP32模型并在此框架中微调的混合方法,成功恢复了量化后的准确率损失,实现了对已优化预训练模型的复用。
  • 所提出的流水线消除了与算子可用性及行为差异相关的部署挑战,实现了从训练图到优化推理图的直接映射。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。