Skip to main content
QUICK REVIEW

[论文解读] XRBench: An Extended Reality (XR) Machine Learning Benchmark Suite for the Metaverse

Hyoukjun Kwon, Krishnakumar Nair|arXiv (Cornell University)|Nov 16, 2022
Advanced Neural Network Applications被引用 12
一句话总结

XRBench 是一个用于扩展现实(XR)机器学习工作负载的开源基准测试套件,旨在评估在实时、场景驱动条件下的多任务多模型(MTMM)推理系统。它引入了一种新颖的评分指标,用于捕捉系统级用户体验质量(QoE),结果表明,在复杂的XR工作负载中,多加速器、场景感知的设计优于传统的单模型系统。

ABSTRACT

Real-time multi-task multi-model (MTMM) workloads, a new form of deep learning inference workloads, are emerging for applications areas like extended reality (XR) to support metaverse use cases. These workloads combine user interactivity with computationally complex machine learning (ML) activities. Compared to standard ML applications, these ML workloads present unique difficulties and constraints. Real-time MTMM workloads impose heterogeneity and concurrency requirements on future ML systems and devices, necessitating the development of new capabilities. This paper begins with a discussion of the various characteristics of these real-time MTMM ML workloads and presents an ontology for evaluating the performance of future ML hardware for XR systems. Next, we present XRBENCH, a collection of MTMM ML tasks, models, and usage scenarios that execute these models in three representative ways: cascaded, concurrent, and cascaded-concurrent for XR use cases. Finally, we emphasize the need for new metrics that capture the requirements properly. We hope that our work will stimulate research and lead to the development of a new generation of ML systems for XR use cases. XRBench is available as an open-source project: https://github.com/XRBench

研究动机与目标

  • 解决扩展现实(XR)和元宇宙应用中实时、多任务多模型(MTMM)机器学习工作负载缺乏公开基准的问题。
  • 刻画 MTMM 工作负载的独特挑战,如场景驱动行为、复杂的模型依赖关系以及严格的 QoE 要求,这些挑战超越了传统单任务单模型(STSM)基准的范畴。
  • 开发一个全面的基准测试套件,真实反映 XR 使用场景,包括级联式、并发式以及混合式执行模式。
  • 引入一种新的系统级评分指标,综合评估在不同使用场景下,延迟、吞吐量、准确率和能效方面的性能表现。
  • 通过提供标准化、面向产业的基准测试,支持机器学习加速器与运行时系统的协同设计,以评估软硬件协同设计的权衡。

提出的方法

  • 基于真实世界元宇宙使用场景,定义 XR 机器学习工作负载的本体论,识别关键特征,如场景驱动执行、模型依赖关系和 QoE 约束。
  • 设计 XRBench 作为涵盖六个 XR 场景(如 VR 游戏、AR 助手、社交互动)的 12 个代表性 MTMM 工作负载集合,每个工作负载均包含级联式、并发式及级联-并发混合式执行模式。
  • 实现一种新颖的评分指标,评估系统性能不依赖于孤立的延迟或 FPS,而是通过综合模型准确率、相对于目标的处理速率达成度以及能效,实现对 QoE 的聚合评估。
  • 使用仿真框架,在不同芯片尺寸(4K 和 8K PEs)和工作负载配置下,评估 12 种加速器类型(如 FDA、SFDA、HDA),测量在不同级联概率下的实时评分与 QoE 表现。
  • 集成真实世界约束,如传感器输入速率限制,以及基于上下文的动态模型激活/去激活机制,确保基准测试真实反映系统级行为。
  • 通过验证表明,不同工作负载偏好不同的加速器架构,且多加速器系统在高复杂度 MTMM 工作负载中展现出更优的可扩展性。

实验结果

研究问题

  • RQ1场景驱动行为与动态模型激活如何影响 XR 机器学习系统的性能与资源利用率?
  • RQ2模型之间的复杂数据与控制依赖关系在多任务多模型工作负载中,对系统调度与硬件设计的制约程度如何?
  • RQ3统一的系统级评分指标能否有效捕捉 XR 应用中多个并发机器学习任务的综合用户体验质量(QoE)?
  • RQ4不同加速器架构(如单加速器 vs. 多加速器、数据流类型)在具有不同模型数量与执行模式的多样化 XR 工作负载中表现如何?
  • RQ5芯片尺寸与加速器类型对实时 MTMM 工作负载中系统协同设计的最优方案有何影响?

主要发现

  • 在高级联概率(100%)条件下,高分加速器(J)保持了更优的实时性能,而低分加速器(B)通过丢帧提升了 QoE,表明在高负载压力下,丢帧可作为一种战略性优化手段。
  • 不同使用场景偏好不同的加速器架构:例如,在社交互动场景中,单加速器 FDA 架构(A)优于其他设计;而在户外活动识别场景中,四加速器 SFDA 架构(F)表现更优。
  • 当芯片尺寸从 4K PEs 扩展到 8K PEs 时,最优加速器架构从 SFDA(H)转变为 HDA(M),表明芯片尺寸显著影响最优加速器设计的选择。
  • 在高复杂度场景(如 AR 助手,6 个模型)中,多加速器系统(如 SFDA 和 HDA)优于单加速器设计;但在低复杂度场景(如 VR 游戏,3 个模型)中表现较差,表明扩展式设计在多模型工作负载中最为有效。
  • XRBench 评分指标成功捕捉了延迟、吞吐量与 QoE 之间的权衡,揭示了若受传感器输入或用户感知限制,仅提升推理延迟至目标处理速率以下并不能改善系统级性能。
  • 该基准测试表明,系统级性能无法通过孤立模型指标进行预测——硬件、调度器与运行时系统的协同设计对于实现最优 XR 机器学习系统性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。