Skip to main content
QUICK REVIEW

[论文解读] Guidelines and Benchmarks for Deployment of Deep Learning Models on Smartphones as Real-Time Apps

Abhishek Sehgal, Nasser Kehtarnavaz|arXiv (Cornell University)|Jan 8, 2019
Advanced Neural Network Applications参考文献 22被引用 5
一句话总结

本文提出了一套统一框架,用于在 Android 和 iOS 平台的智能手机上以实时应用形式部署深度学习模型。该框架利用开源工具、多线程技术进行性能优化,并配备基准测试套件,用于衡量准确性、CPU/GPU 使用率和吞吐量——在六种卷积神经网络(CNN)模型上进行了验证,均实现了经证实的实时推理能力。

ABSTRACT

Deep learning solutions are being increasingly used in mobile applications. Although there are many open-source software tools for the development of deep learning solutions, there are no guidelines in one place in a unified manner for using these tools towards real-time deployment of these solutions on smartphones. From the variety of available deep learning tools, the most suited ones are used in this paper to enable real-time deployment of deep learning inference networks on smartphones. A uniform flow of implementation is devised for both Android and iOS smartphones. The advantage of using multi-threading to achieve or improve real-time throughputs is also showcased. A benchmarking framework consisting of accuracy, CPU/GPU consumption and real-time throughput is considered for validation purposes. The developed deployment approach allows deep learning models to be turned into real-time smartphone apps with ease based on publicly available deep learning and smartphone software tools. This approach is applied to six popular or representative convolutional neural network models and the validation results based on the benchmarking metrics are reported.

研究动机与目标

  • 解决在智能手机上以实时应用形式部署深度学习模型时缺乏统一、实用指南的问题。
  • 建立一种标准化的、跨平台(Android 和 iOS)的工作流程,用于部署预训练的深度学习推理网络。
  • 通过准确性、计算资源消耗(CPU/GPU)和实时吞吐量指标,对模型性能进行评估与基准测试。
  • 展示多线程技术在提升实时运行下推理吞吐量方面的有效性。
  • 在六种具有代表性的卷积神经网络模型上对框架进行验证。

提出的方法

  • 为 Android 和 iOS 平台设计了统一的软件部署流水线,使用公开可用的深度学习和移动开发工具。
  • 通过并行化模型推理和输入处理,实现多线程技术,以提升实时推理吞吐量。
  • 建立基准测试框架,包含三个核心指标:模型准确性、CPU/GPU 利用率和实时推理吞吐量(每秒帧数)。
  • 使用与移动平台兼容的设备端推理引擎,对预训练的卷积神经网络模型进行适配和部署。
  • 部署流水线集成了模型量化和优化技术,以在不显著损失准确性的情况下降低计算负载。
  • 在真实智能手机上评估性能,以确保在典型移动工作负载下实现实际的实时运行。

实验结果

研究问题

  • RQ1如何为 Android 和 iOS 智能手机上的深度学习模型提供一种统一且实用的实时应用部署工作流程?
  • RQ2如何有效利用多线程技术提升移动设备上的实时推理吞吐量?
  • RQ3在智能手机上部署深度学习模型时,模型准确性、CPU/GPU 使用率和推理速度之间的权衡关系是什么?
  • RQ4从一组具有代表性的模型中,哪些深度学习模型能够在消费级智能手机上实现实时性能?
  • RQ5不同的优化策略如何影响设备端推理的效率和延迟?

主要发现

  • 所提出的部署框架成功实现在消费级智能手机上对六种不同 CNN 模型的实时推理,且在各类设备上均实现了稳定的吞吐量。
  • 多线程技术显著提升了实时性能,在输入处理和推理流水线中均实现了每秒帧数的可测量提升。
  • 基准测试框架有效捕捉了模型准确性与计算效率之间的权衡,有助于在移动端部署中做出明智的模型选择。
  • CPU 和 GPU 利用率指标表明,经过优化的模型在满足实时约束(如 30 FPS)的同时,保持了较低的资源消耗。
  • 该方法具有可复现性和可重用性,仅依赖公开可用的工具,使研究人员和开发者均可轻松访问。
  • 本研究证明,使用标准开源工具链在智能手机上实现深度学习模型的实时部署是可行且实用的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。