Skip to main content
QUICK REVIEW

[论文解读] MLModelScope: A Distributed Platform for Model Evaluation and Benchmarking at Scale

Abdul Dakkak, Cheng Li|arXiv (Cornell University)|Feb 19, 2020
Machine Learning in Materials Science被引用 5
一句话总结

MLModelScope 是一个分布式的、与框架和硬件无关的平台,通过标准化规范和可扩展的运行时,实现可扩展、可重复且公平的模型评估与基准测试。它支持在多样化硬件和软件堆栈上并行评估,具备可观测性功能,可揭示模型在层和库级别的性能瓶颈,展示了在相同模型和硬件上,TensorRT 与 Caffe2 等框架之间显著的性能差异。

ABSTRACT

Machine Learning (ML) and Deep Learning (DL) innovations are being introduced at such a rapid pace that researchers are hard-pressed to analyze and study them. The complicated procedures for evaluating innovations, along with the lack of standard and efficient ways of specifying and provisioning ML/DL evaluation, is a major "pain point" for the community. This paper proposes MLModelScope, an open-source, framework/hardware agnostic, extensible and customizable design that enables repeatable, fair, and scalable model evaluation and benchmarking. We implement the distributed design with support for all major frameworks and hardware, and equip it with web, command-line, and library interfaces. To demonstrate MLModelScope's capabilities we perform parallel evaluation and show how subtle changes to model evaluation pipeline affects the accuracy and HW/SW stack choices affect performance.

研究动机与目标

  • 为应对快速演进的机器学习/深度学习模型、框架和硬件堆栈在评估过程中日益增长的挑战,实现可重复且公平的评估。
  • 通过将规范与硬件/软件资源配置解耦,降低模型评估的复杂性和耗时。
  • 提供一个标准化、可扩展且可定制的平台,支持在多样化机器学习框架和加速器之间实现可复现的基准测试。
  • 实现对模型执行过程的细粒度可观测性,以识别在层和库级别的性能瓶颈。
  • 支持大规模、并行评估,并保证一致的报告输出和可复现性。

提出的方法

  • 该平台采用基于文本的模型评估规范,将模型处理流程(预处理、推理、后处理)与底层硬件/软件堆栈解耦。
  • 一个分布式运行时系统消费该规范及用户定义的硬件约束,以在异构环境中配置并执行评估。
  • 系统支持多种机器学习框架(如 PyTorch、TensorFlow、Caffe2、TensorRT)和硬件平台(x86、ARM、Power、CPU、GPU、FPGA)。
  • 提供三种访问接口:命令行、库接口和 Web UI,以提升易用性和系统集成能力。
  • 平台内置性能分析器,可捕获各层和库级别的延迟与内存使用情况,实现性能可观测性。
  • 评估结果以一致方式报告,支持在不同模型、框架和硬件配置之间进行公平比较。

实验结果

研究问题

  • RQ1如何在多样化硬件和软件堆栈之间实现模型评估的可扩展性、可重复性和公平性?
  • RQ2不同框架的实现差异在相同硬件上对模型推理性能的影响有多大?
  • RQ3统一的规范与运行时系统是否能减少大规模模型基准测试的时间与复杂度?
  • RQ4硬件与软件堆栈的选择如何影响模型在层和库级别的准确率与性能?
  • RQ5在不同框架之间,对模型执行过程进行子模型粒度的可观测性分析,能获得哪些有价值的洞察?

主要发现

  • MLModelScope 支持在多样化硬件和软件堆栈上实现并行、可扩展的模型评估,结果一致且可复现。
  • 在相同硬件(Amazon p3.2xlarge)上,TensorRT 将首个卷积层和 ReLU 层融合为单个内核,执行时间仅为 1.95ms,而 Caffe2 未进行融合,导致执行时间更长,达 2.63ms。
  • 平台的可观测性功能揭示,不同框架使用不同的库函数实现相同的模型层,从而导致可测量的性能差异。
  • MLModelScope 已成功集成 MLPerf Inference 和 AI-Matrix 等基准测试套件中的模型,支持其进行分布式评估与性能分析。
  • 平台表明,模型评估流程中的细微变化(如预处理操作)可能显著影响最终的准确率与性能结果。
  • 通过将规范与执行解耦,MLModelScope 显著缩短了模型评估者的测试时间,并支持在不同模型与技术栈之间实现一致且公平的比较。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。