[论文解读] Flexible Deep Neural Network Processing
本文提出了一种灵活的深度神经网络(DNN)集成推理技术,通过元推理器动态评估置信度差距,决定何时停止推理,相较于在ImageNet上使用AlexNet和ResNet-50进行完整集成推理,实现了高达2倍的延迟降低,且仅带来0.1%的准确率下降。
The recent success of Deep Neural Networks (DNNs) has drastically improved the state of the art for many application domains. While achieving high accuracy performance, deploying state-of-the-art DNNs is a challenge since they typically require billions of expensive arithmetic computations. In addition, DNNs are typically deployed in ensemble to boost accuracy performance, which further exacerbates the system requirements. This computational overhead is an issue for many platforms, e.g. data centers and embedded systems, with tight latency and energy budgets. In this article, we introduce flexible DNNs ensemble processing technique, which achieves large reduction in average inference latency while incurring small to negligible accuracy drop. Our technique is flexible in that it allows for dynamic adaptation between quality of results (QoR) and execution runtime. We demonstrate the effectiveness of the technique on AlexNet and ResNet-50 using the ImageNet dataset. This technique can also easily handle other types of networks.
研究动机与目标
- 解决在实时和资源受限系统中部署DNN集成时面临的高推理延迟和计算成本问题。
- 通过实现结果质量(QoR)与运行时之间的动态适应,克服DNN推理中准确率与延迟之间的权衡。
- 开发一种灵活的计算框架,使在预测置信度较高时能够提前终止推理,从而减少不必要的计算。
- 证明该方法在显著降低平均推理时间的同时,仍能保持完整集成的大部分准确率优势。
提出的方法
- 引入一个元推理器,在每次DNN推理步骤后评估得分差距(即前两名softmax概率的差值)。
- 采用基于阈值的提前停止机制:若得分差距超过动态设定的阈值,则停止推理并返回当前预测结果。
- 基于经验网格搜索,为每种集成规模设定不同的阈值,以最小化一个综合目标函数,该函数平衡延迟与准确率损失。
- 将目标函数定义为 $ M = \alpha \cdot R + (1 - \alpha) \cdot E $,其中 $ R $ 为延迟,$ E $ 为与完整集成相比的相对误差增加量。
- 在单个GPU上串行应用该方法,使其适用于仅能同时运行一个DNN的低资源平台。
- 使用后softmax输出得分计算差距,确保数值落在[0,1]范围内,以实现一致的阈值设定。
实验结果
研究问题
- RQ1在DNN集成中采用动态提前停止是否能有效降低平均推理延迟,同时避免显著的准确率下降?
- RQ2不同置信度阈值设置下,推理延迟与准确率之间的权衡关系如何变化?
- RQ3灵活的集成处理在多大程度上能够维持完整集成的准确率优势,同时降低计算负载?
- RQ4该方法是否可泛化应用于不同DNN架构(如AlexNet和ResNet-50)?
- RQ5何种最优阈值配置能够最小化延迟与准确率损失的综合成本?
主要发现
- 对于包含7个DNN的AlexNet集成,灵活处理将平均推理延迟从11.67 ms降低至6.51 ms,减少了50%,同时准确率保持在0.6032,与完整集成的0.6043相比仅下降0.1%。
- 在AlexNet案例中,准确率下降仅为0.1%,表明在实现显著延迟降低的同时,性能损失极小。
- 该技术支持可调节的权衡:通过调整置信度阈值,用户可控制延迟与准确率之间的平衡,且可完全禁用提前停止以实现零准确率损失。
- 该方法在不同DNN架构上均表现有效,已在AlexNet和ResNet-50上使用ImageNet数据集得到验证。
- 由于计算开销低且兼容串行执行,该方法适用于广泛的系统,包括嵌入式平台和数据中心。
- 该方法可扩展至其他神经网络类型和机器学习模型,为资源受限环境下的推理提供一种通用解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。