Skip to main content
QUICK REVIEW

[论文解读] Contention-Aware GPU Partitioning and Task-to-Partition Allocation for Real-Time Workloads

Houssam-Eddine Zahaf, Ignacio Sanudo Olmedo|arXiv (Cornell University)|May 21, 2021
Parallel Computing and Optimization Techniques参考文献 17被引用 8
一句话总结

本文提出了面向实时工作负载的争用感知GPU分区与任务到分区的分配启发式方法,通过将内存密集型和计算密集型任务分组到同一分区中,减少多核执行时的干扰。该方法在非分区GPU执行基础上提升了可调度性与效率,最多支持25个分区(每分区两个任务),在资源争用下的实时工作负载调度中优于基线方法。

ABSTRACT

In order to satisfy timing constraints, modern real-time applications require massively parallel accelerators such as General Purpose Graphic Processing Units (GPGPUs). Generation after generation, the number of computing clusters made available in novel GPU architectures is steadily increasing, hence, investigating suitable scheduling approaches is now mandatory. Such scheduling approaches are related to mapping different and concurrent compute kernels within the GPU computing clusters, hence grouping GPU computing clusters into schedulable partitions. In this paper we propose novel techniques to define GPU partitions; this allows us to define suitable task-to-partition allocation mechanisms in which tasks are GPU compute kernels featuring different timing requirements. Such mechanisms will take into account the interference that GPU kernels experience when running in overlapping time windows. Hence, an effective and simple way to quantify the magnitude of such interference is also presented. We demonstrate the efficiency of the proposed approaches against the classical techniques that considered the GPU as a single, non-partitionable resource.

研究动机与目标

  • 解决因共享SM和内存上核函数重叠执行导致的实时GPU工作负载中资源争用与不可预测性问题。
  • 通过基于任务特征将GPU资源划分为隔离的、可调度的单元,提升GPU利用率与时间可预测性。
  • 设计基于启发式的任务到分区分配策略,以最小化共驻核函数之间的干扰。
  • 在实时系统中证明该方法优于非分区GPU执行与经典调度方法。
  • 支持与现有GPU框架(如NVIDIA MIG和AMD CU屏蔽)集成,实现实际部署。

提出的方法

  • 提出基于核函数运行时与资源需求的SM分组启发式方法,将Streaming Multiprocessors(SMs)划分为可调度的分区。
  • 引入争用度量以量化并发核函数之间共享内存与计算资源造成的干扰。
  • 采用两种任务分配启发式策略:最佳匹配(BF)与最小内存大小(SMS),均旨在通过匹配互补工作负载来最小化干扰。
  • 使用禁止配对列表,防止冲突的核函数对(如两个内存密集型任务)被分配至同一分区。
  • 应用可调度性分析框架,评估总利用率,并在分区执行下保证时间约束。
  • 通过具有不同任务数(50和200个任务)与利用率水平的合成工作负载验证方法,与非分区基线(1G)进行对比。

实验结果

研究问题

  • RQ1如何定义GPU分区以最小化具有不同运行时与资源需求的实时核函数之间的干扰?
  • RQ2何种任务到分区的分配策略能在多核GPU工作负载中最佳平衡资源利用率与干扰减少?
  • RQ3与非分区GPU执行相比,争用感知分区在可调度性方面提升程度如何?
  • RQ4在不同工作负载与干扰条件下,不同启发式策略(BF与SMS)的表现如何?
  • RQ5所提方法是否可与现有GPU虚拟化功能(如NVIDIA MIG或AMD CU屏蔽)集成?

主要发现

  • 所提启发式方法在所有测试利用率水平下均实现接近1.0的可调度率,显著优于非分区基线(1G),后者在高利用率下表现出较差的可调度性。
  • 在调度50个任务时,平均分区数约为25,表明每分区约两个任务,符合最小化干扰的目标。
  • 最佳匹配(BF)启发式方法因减少候选合并操作,效率更高且分析时间更短,优于SMS。
  • 在200个任务场景下,聚类效率下降,因每分区任务密度增加(平均超过四个任务/分区),导致干扰增加与性能下降。
  • 分析时间基本与总利用率无关,BF方法因逻辑更简单,分析速度优于SMS方法。
  • 该方法展现出强可扩展性与鲁棒性,在高资源争用下仍保持高可调度性,证明其在实时GPU工作负载中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。