Skip to main content
QUICK REVIEW

[论文解读] MLPerf Mobile Inference Benchmark: Why Mobile AI Benchmarking Is Hard and What to Do About It.

Vijay Janapa Reddi, David Kanter|arXiv (Cornell University)|Dec 3, 2020
Advanced Neural Network Applications参考文献 22被引用 4
一句话总结

MLPerf Mobile 引入了首个行业标准、开源的基准测试,用于评估跨多样化软硬件堆栈的移动AI性能。它通过统一的模型、数据集、度量标准和运行规则,实现了对移动设备上计算机视觉和自然语言处理工作负载的公平、可复现、标准化的推理基准测试。

ABSTRACT

MLPerf Mobile is the first industry-standard open-source mobile benchmark developed by industry members and academic researchers to allow performance/accuracy evaluation of mobile devices with different AI chips and software stacks. The benchmark draws from the expertise of leading mobile-SoC vendors, ML-framework providers, and model producers. In this paper, we motivate the drive to demystify mobile-AI performance and present MLPerf Mobile's design considerations, architecture, and implementation. The benchmark comprises a suite of models that operate under standard models, data sets, quality metrics, and run rules. For the first iteration, we developed an app to provide an out-of-the-box inference-performance benchmark for computer vision and natural-language processing on mobile devices. MLPerf Mobile can serve as a framework for integrating future models, for customizing quality-target thresholds to evaluate system performance, for comparing software frameworks, and for assessing heterogeneous-hardware capabilities for machine learning, all fairly and faithfully with fully reproducible results.

研究动机与目标

  • 解决在异构软硬件平台之间评估移动AI性能时缺乏标准化、可复现基准测试的问题。
  • 通过统一框架消除移动AI性能的神秘性,公平评估推理速度、准确率和效率。
  • 实现对移动设备上机器学习框架、硬件加速器和系统优化的持续比较。
  • 为未来模型集成和移动AI评估中的可定制质量目标阈值提供基础。
  • 通过完整记录的运行规则、数据集和评估指标,确保基准测试的透明度和保真度。

提出的方法

  • 设计一个标准化的基准测试套件,包含为计算机视觉和自然语言处理精选的机器学习模型。
  • 定义一致的数据集、质量度量标准和运行规则,以确保在不同设备和配置下具备可复现性和公平性。
  • 实施基于应用程序的执行框架,以实现在移动设备上开箱即用的推理基准测试。
  • 整合领先移动-SoC厂商、机器学习框架提供商和模型生产方的贡献,以确保基准测试具有现实相关性。
  • 建立模块化架构,支持未来新增模型和可定制的质量阈值。
  • 严格执行和测量协议,确保在多样化移动平台之间结果的一致性和可比性。

实验结果

研究问题

  • RQ1如何在多样化软硬件堆栈之间一致地评估移动AI性能?
  • RQ2为确保移动AI基准测试的公平性、可复现性和标准化,需要哪些设计原则?
  • RQ3如何设计基准测试以支持未来模型的集成和可定制的质量目标?
  • RQ4标准化的数据集、度量标准和运行规则在实现可靠跨平台比较中起到什么作用?
  • RQ5产业界与学术界如何有效协作,以构建一个可信的移动AI基准测试?

主要发现

  • MLPerf Mobile 提供了一个标准化、开源的基准测试,可在多样化设备和硬件加速器上实现公平且可复现的移动AI推理评估。
  • 该基准测试套件包含计算机视觉和自然语言处理的模型,确保在关键移动AI工作负载中的广泛适用性。
  • 通过统一数据集、度量标准和运行规则,MLPerf Mobile 消除了不同平台之间性能测量的不一致性。
  • 基于应用程序的实现方式支持开箱即用的推理基准测试,降低了开发人员和研究人员的设置门槛。
  • 该框架支持未来可扩展性,可实现新模型的集成和系统评估中可定制的质量阈值。
  • 产业界与学术界的协作确保了基准测试真实反映了移动AI部署的现实场景,具备高度保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。