Skip to main content
QUICK REVIEW

[论文解读] BenchCouncil's View on Benchmarking AI and Other Emerging Workloads

Jianfeng Zhan, Lei Wang|arXiv (Cornell University)|Dec 2, 2019
Software System Performance and Reliability参考文献 21被引用 7
一句话总结

本文提出了 PRDAERS 框架,用于对人工智能、大数据和互联网服务等现代工作负载进行基准测试,解决了碎片化、隔离性和随机性等挑战。该框架倡导使用简单、抽象且可移植的抽象模型(如数据模式),以实现在不同架构上的高效、通用的基准测试。

ABSTRACT

This paper outlines BenchCouncil's view on the challenges, rules, and vision of benchmarking modern workloads like Big Data, AI or machine learning, and Internet Services. We conclude the challenges of benchmarking modern workloads as FIDSS (Fragmented, Isolated, Dynamic, Service-based, and Stochastic), and propose the PRDAERS benchmarking rules that the benchmarks should be specified in a paper-and-pencil manner, relevant, diverse, containing different levels of abstractions, specifying the evaluation metrics and methodology, repeatable, and scaleable. We believe proposing simple but elegant abstractions that help achieve both efficiency and general-purpose is the final target of benchmarking in future, which may be not pressing. In the light of this vision, we shortly discuss BenchCouncil's related projects.

研究动机与目标

  • 应对人工智能、大数据和互联网服务等现代工作负载基准测试日益增长的挑战。
  • 克服新兴工作负载中普遍存在的碎片化、隔离性、动态复杂性、服务化架构和随机性问题。
  • 建立一种原则性、可重复且可扩展的基准测试方法论,适用于多样化的计算环境。
  • 推动开发简单、优雅的抽象模型(如数据模式),以统一系统间效率与通用性。
  • 通过 BENCHCPU 和 EChip 等项目,推进开放、可移植且互操作的基准测试。

提出的方法

  • 提出 PRDAERS 作为基准测试框架:纸笔规格说明、相关性、多样性,具备多层抽象、评估指标与方法、可重复性及可扩展性。
  • 引入数据模式——如矩阵、集合、图和排序等可重用计算模式——作为建模大数据和人工智能工作负载的基础抽象。
  • 设计 BENCHCPU,作为可移植的、与指令集架构无关的基准测试套件,用于刻画边缘、物联网和数据中心系统中的新兴工作负载。
  • 开发 EChip,一个开源、可扩展的指令集架构,结合通用指令与领域专用指令,适用于人工智能和数据密集型工作负载。
  • 应用功能工作负载建模与抽象层,以提炼关键工作负载属性,同时保持语义保真度。
  • 采用多场景基准测试方法,区分物联网、边缘、数据中心和高性能计算(HPC)环境。

实验结果

研究问题

  • RQ1基准测试如何应对现代人工智能和数据密集型工作负载中普遍存在的 FIDSS 挑战——即碎片化、隔离性、动态性、服务化和随机性?
  • RQ2哪些原则可确保基准测试在不断演进的软硬件栈中保持相关性、可重复性和可扩展性?
  • RQ3像数据模式这样的简单、优雅的抽象模型,能否统一多样化的 AI 和大数据工作负载,同时保持性能与可移植性?
  • RQ4开放、社区驱动的基准测试举措如何克服产业界与学术界之间真实数据与模型的隔离问题?
  • RQ5领域专用指令集与通用指令集架构在像 EChip 这样单一、可扩展且开放的架构中,能在多大程度上共存?

主要发现

  • 与传统基准测试相比,FIDSS 挑战——即碎片化、隔离性、动态性、服务化和随机性——显著增加了现代工作负载基准测试的复杂性。
  • PRDAERS 框架为基准测试提供了结构化方法,确保了规格说明的清晰性、相关性、多样性和跨系统的可扩展性。
  • 如矩阵、集合、图和排序等数据模式,捕获了大数据和人工智能工作负载中大部分的运行时间,使其成为统一抽象的有力候选。
  • BENCHCPU 正作为可移植的、与指令集架构无关的基准测试套件开发,用于刻画边缘、物联网和数据中心平台上的新兴工作负载。
  • EChip 是一个开源、可扩展的指令集架构,结合了稳定且与 Linux 兼容的通用指令集与可定制的领域专用扩展,适用于人工智能和数据工作负载。
  • 本文结论认为,尽管简单而优雅的通用效率抽象是长期目标,但目前尚不紧迫;然而,BenchCouncil 的项目已启动基础性工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。