[论文解读] Auto-tuning Neural Network Quantization Framework for Collaborative Inference Between the Cloud and Edge
本文提出了一种用于云边协同推理的自动调优神经网络量化框架,可自动识别深度神经网络中最佳的混合精度分割点。通过将早期层量化并在移动边缘设备上执行,同时将后期层卸载至云端,该框架将模型存储量最多减少99.97%,并在ImageNet基准测试中实现1.7倍的加速,且精度损失小于0.2%。
Recently, deep neural networks (DNNs) have been widely applied in mobile intelligent applications. The inference for the DNNs is usually performed in the cloud. However, it leads to a large overhead of transmitting data via wireless network. In this paper, we demonstrate the advantages of the cloud-edge collaborative inference with quantization. By analyzing the characteristics of layers in DNNs, an auto-tuning neural network quantization framework for collaborative inference is proposed. We study the effectiveness of mixed-precision collaborative inference of state-of-the-art DNNs by using ImageNet dataset. The experimental results show that our framework can generate reasonable network partitions and reduce the storage on mobile devices with trivial loss of accuracy.
研究动机与目标
- 解决在移动设备上仅使用云端DNN推理时存在的高传输开销和隐私风险问题。
- 通过边缘部署降低移动AI应用中的模型存储和通信成本。
- 利用混合精度量化实现高效且保护隐私的协同推理。
- 自动化选择云边工作负载的最佳网络分割点。
- 在最大化推理速度和存储减少的同时,最小化精度下降。
提出的方法
- 分析DNN层结构,基于计算和内存特性识别候选分割点。
- 对网络早期层应用INT8标量量化,以减少边缘设备上的存储和计算开销。
- 利用设备端性能分析测量每个候选分割点的推理延迟和通信开销。
- 采用自动调优算法评估所有候选分割点,并根据速度与精度的权衡选择最优方案。
- 在边缘设备上执行网络的前半部分(量化),在云端执行剩余部分(全精度),以平衡性能与隐私。
- 利用优化的低精度库(如gemmlowp、cuDNN)加速边缘和云端的推理。
实验结果
研究问题
- RQ1在云边协同推理架构中,DNN的哪些层最适合进行分割?
- RQ2如何利用混合精度量化在不造成显著精度损失的前提下最小化模型大小和通信开销?
- RQ3在无线环境中,如何找到在推理速度、存储和精度之间达到最佳平衡的最优网络分割点?
- RQ4自动调优能否有效识别出如ResNet和VGG等多样化SOTA DNN的最佳分割点?
- RQ5与仅使用云端的推理相比,协同推理在减少数据传输和提升隐私保护方面能达到何种程度?
主要发现
- 通过选择conv5作为最优分割点,该框架在AlexNet上实现了1.7倍的加速,显著降低了低带宽环境下的传输开销。
- 移动设备上的模型存储量在AlexNet上减少了96.17%,VGG16上减少了99.97%,ResNet-18上减少了85.63%,GoogLeNet上减少了98.22%。
- 所有测试网络中最大的精度下降仅为-0.11%,大多数模型的精度下降可忽略不计(≤0.1%)。
- 当传输开销较高时,协同推理在速度上优于仅使用云端的推理,尤其在低带宽无线环境下表现更优。
- 该框架成功识别出每种网络的最佳且最快速的分割点,证明了其在多种架构上的鲁棒性。
- 中间特征图以低精度格式传输,减少了通信量并增强了用户隐私保护。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。