Skip to main content
QUICK REVIEW

[论文解读] ROME: A Multi-Resource Job Scheduling Framework for Exascale HPC Systems

Yuping Fan|arXiv (Cornell University)|Aug 18, 2021
Distributed and Parallel Computing Systems参考文献 8被引用 7
一句话总结

ROME 是一种用于百亿亿次级 HPC 系统的多资源作业调度框架,采用遗传算法优化计算节点、突发缓冲区和内存等多样化资源的利用率,同时通过基于窗口的机制维持作业公平性。在基于 Mira 日志的追踪仿真中,该框架可将资源利用率提升高达 20%,并将平均作业等待时间减少。

ABSTRACT

High-performance computing (HPC) is undergoing significant changes. Next generation HPC systems are equipped with diverse global and local resources, such as I/O burst buffer resources, memory resources (e.g., on-chip and off-chip RAM, external RAM/NVRA), network resources, and possibly other resources. Job schedulers play a crucial role in efficient use of resources. However, traditional job schedulers are single-objective and fail to efficient use of other resources. In this paper, we propose ROME, a novel multi-dimensional job scheduling framework to explore potential tradeoffs among multiple resources and provides balanced scheduling decision. Our design leverages genetic algorithm as the multi-dimensional optimization engine to generate fast scheduling decision and to support effective resource utilization.

研究动机与目标

  • 应对百亿亿次级 HPC 系统日益增长的复杂性,这些系统集成了如突发缓冲区、内存和网络等多样化的全局与本地资源。
  • 克服传统单目标作业调度器在高效管理多种资源类型方面的局限性。
  • 开发一种可扩展的实时调度解决方案,能够在严格的时间约束(30 秒内)下处理多维优化问题。
  • 通过基于窗口的机制保持作业公平性与性能之间的平衡,维护作业的原始顺序。
  • 通过决策模块实现对竞争性资源目标的有效权衡,优先考虑计算利用率,同时提升其他资源的利用率。

提出的方法

  • 采用基于窗口的机制,从已排序的等待队列中选取前 w 个作业,以限制调度范围并维持公平性。
  • 将多维调度问题建模为双目标优化问题:在资源容量约束下,最大化计算节点利用率和突发缓冲区利用率。
  • 使用遗传算法(GA)高效探索庞大的解空间(2^w),并在 30 秒内生成非支配调度解。
  • 在各代之间应用遗传算法操作——交叉和变异——以演化出高质量的调度解。
  • 实现一个决策模块,首先选择计算利用率最高的解,然后仅在其他解能将非计算资源利用率提升超过 40% 且计算利用率下降不超过 10% 的情况下,才替换该解。
  • 在每次作业提交或完成触发的调度实例中,集成实时资源利用率数据(如已使用节点、突发缓冲区、内存)到调度器中。

实验结果

研究问题

  • RQ1作业调度器如何在百亿亿次级 HPC 系统中有效管理计算、突发缓冲区和内存等异构资源?
  • RQ2在多资源、时间受限的环境中,使用遗传算法对调度性能和解质量有何影响?
  • RQ3基于窗口的机制是否能够在实现高效多资源优化的同时保持作业公平性?
  • RQ4何种权衡策略能够有效从一组非支配最优解中选择出单一优选解?
  • RQ5多维调度在真实 HPC 工作负载中,能在多大程度上减少作业等待时间并提升资源利用率?

主要发现

  • 在基于 Mira 日志的追踪仿真中,ROME 相较于传统调度器,将整体系统资源利用率最高提升了 20%。
  • 该框架通过在计算、突发缓冲区和内存资源之间有效平衡资源分配,显著降低了平均作业等待时间。
  • 遗传算法求解器在规定的 30 秒窗口内生成了高质量的调度解,适用于实时部署。
  • 决策模块成功识别出首选解,优先保障计算利用率,同时在其他资源利用率方面实现超过 40% 的显著提升,且计算性能下降不足 10%。
  • 基于窗口的机制在保持作业顺序和公平性的同时,实现了大规模作业队列的可扩展调度。
  • 多维优化模型有效捕捉了在系统级资源约束下,突发缓冲区利用率与计算节点利用率等竞争目标之间的权衡关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。