Skip to main content
QUICK REVIEW

[论文解读] AI Matrix: A Deep Learning Benchmark for Alibaba Data Centers

Wei Zhang, Wei Wei|arXiv (Cornell University)|Sep 23, 2019
Advanced Neural Network Applications参考文献 23被引用 11
一句话总结

AI Matrix 是为阿里巴巴数据中心开发的全面深度学习基准测试套件,涵盖计算机视觉、推荐系统和自然语言处理领域的实际电商工作负载。该套件覆盖了阿里巴巴基础设施中90%的GPU使用率,支持硬件选型、性能分析与系统优化,并已将20个基准中的17个公开,供工业界和学术界使用。

ABSTRACT

Alibaba has China's largest e-commerce platform. To support its diverse businesses, Alibaba has its own large-scale data centers providing the computing foundation for a wide variety of software applications. Among these applications, deep learning (DL) has been playing an important role in delivering services like image recognition, objection detection, text recognition, recommendation, and language processing. To build more efficient data centers that deliver higher performance for these DL applications, it is important to understand their computational needs and use that information to guide the design of future computing infrastructure. An effective way to achieve this is through benchmarks that can fully represent Alibaba's DL applications.

研究动机与目标

  • 为解决缺乏针对阿里巴巴大规模电商工作负载的代表性深度学习基准测试的问题。
  • 开发一个能够真实反映阿里巴巴数据中心实际深度学习应用计算需求的基准测试套件。
  • 通过准确刻画当前深度学习系统中的性能瓶颈,支持未来硬件设计与软件优化。
  • 提供一个公共资源,惠及硬件厂商、研究人员及工业组织。

提出的方法

  • 收集阿里巴巴生产系统中实际使用的代表性深度学习模型,涵盖计算机视觉、推荐系统和自然语言处理领域。
  • 基于模型的普及程度和计算特性进行筛选,确保其覆盖阿里巴巴数据中心90%以上的GPU使用率。
  • 在NVIDIA V100 GPU上测量关键性能指标,包括FLOPs、内存读取量、算术强度以及每批次的推理时间。
  • 构建屋顶线(roofline)模型以分析计算与内存利用率,识别出尽管算术强度高但仍存在资源利用率不足的问题。
  • 设计基准测试以支持低精度推理(FP16、INT8)、混合精度训练(FP32/FP16)以及多GPU系统的分布式训练。
  • 通过GitHub和AI Matrix官网公开发布20个基准中的17个,以支持社区使用与结果可复现性。

实验结果

研究问题

  • RQ1现有深度学习基准测试对阿里巴巴真实电商工作负载的代表性如何?
  • RQ2阿里巴巴数据中心生产级深度学习工作负载的主要计算特征(如算术强度、内存访问模式)是什么?
  • RQ3为何在许多深度学习模型中,尽管算术强度高,GPU计算利用率仍不理想?
  • RQ4如何设计一个面向生产环境的基准测试,以指导大规模数据中心未来的软硬件协同设计?
  • RQ5模型多样性与规模对系统级性能与资源利用率的影响如何?

主要发现

  • AI Matrix 覆盖了阿里巴巴数据中心90%以上的GPU使用率,高度代表实际生产工作负载。
  • 尽管算术强度高,许多基准测试(尤其是推荐系统与自然语言处理领域)仍表现出显著的GPU计算资源利用率不足。
  • 屋顶线模型分析表明,性能瓶颈主要来自内存带宽限制和内核调用效率低下,即使在高算术强度工作负载中亦如此。
  • 推荐模型如DIN和Wide & Deep由于全连接层与嵌入层参数量巨大,表现出较低的算术强度。
  • 计算机视觉与自然语言处理模型如CRNN、SegLink、BERT与NMT因卷积与循环层的存在,表现出高算术强度。
  • 该基准测试套件已公开发布(20个模型中的17个),可广泛用于硬件与软件优化领域的研究与工业应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。