Skip to main content
QUICK REVIEW

[论文解读] A Simulator for Data-Intensive Job Scheduling

Matteo Dell’Amico|arXiv (Cornell University)|Jun 25, 2013
Cloud Computing and Resource Management参考文献 15被引用 7
一句话总结

本文提出了一种基于仿真的评估方法,用于数据密集型批处理系统中基于作业大小的调度策略,其中作业大小是估计值而非确切值。尽管存在显著的估计误差(对数正态分布,σ=1),FSP+PS 调度器始终优于 FIFO 和公平共享策略,将平均停留时间减少了一个数量级以上,并对不精确的大小预测表现出极强的鲁棒性。

ABSTRACT

Despite the fact that size-based schedulers can give excellent results in terms of both average response times and fairness, data-intensive computing execution engines generally do not employ size-based schedulers, mainly because of the fact that job size is not known a priori. In this work, we perform a simulation-based analysis of the performance of size-based schedulers when they are employed with the workload of typical data-intensive schedules and with approximated size estimations. We show results that are very promising: even when size estimation is very imprecise, response times of size-based schedulers can be definitely smaller than those of simple scheduling techniques such as processor sharing or FIFO.

研究动机与目标

  • 评估在作业大小事先未知的数据密集型批处理工作负载中,基于大小的调度器的可行性和性能。
  • 评估大小估计误差对调度性能的影响,特别是对平均停留时间和公平性的影响。
  • 在真实的工作负载轨迹和估计不确定性下,比较不同调度策略(FIFO、处理器共享(PS)、FSP 和混合型 FSP+PS)的有效性。
  • 提供实证证据以支持 HFSP Hadoop 调度器的设计,利用仿真结果指导实际部署。
  • 分析调度性能对系统负载和控制作业大小分布的 d/n 参数的敏感性。

提出的方法

  • 作者开发了一个基于 Python 的自定义仿真器,使用 numpy 和 matplotlib,抽象出底层执行引擎的细节,专注于调度逻辑。
  • 作业被建模为(到达时间,执行时间)对,执行时间来自真实 Hadoop 工作负载轨迹(FB09-0、FB09-1、FB10)。
  • 大小估计误差通过对数正态分布建模:估计大小 ŝ = sX,其中 X ~ Log-N(0, σ²),从而实现可控的误差水平。
  • 仿真器实现了标准调度器:FIFO、处理器共享(PS)、最短剩余处理时间(SRPT)以及基于公平性的大小策略(FSP),包括混合变体如 FSP+PS 和 FSP+FIFO。
  • 性能通过平均停留时间(从提交到完成的时间)进行评估,结果在多次仿真运行中取平均以确保稳定性。
  • 仿真评估了三个关键系统参数:负载(l)、估计误差(σ)以及控制作业大小分布偏度的 d/n 参数。

实验结果

研究问题

  • RQ1当作业大小是估计值而非确切值时,在真实的数据密集型工作负载中,基于大小的调度器表现如何?
  • RQ2将大小估计误差(建模为对数正态分布)对批处理作业调度中平均停留时间和公平性的影响是什么?
  • RQ3在响应时间和对估计误差的鲁棒性方面,FSP+PS 调度器相较于 FIFO、PS 和 FSP+FIFO 的表现如何?
  • RQ4系统负载如何影响基于大小与非基于大小的调度器之间的性能差距?
  • RQ5调度性能对控制作业大小分布形状的 d/n 参数的敏感性如何?

主要发现

  • 即使估计误差较高(σ=1),即超过 50% 的估计值偏差超过 2 倍,FSP+PS 调度器仍能将平均停留时间相比 FIFO 显著减少一个数量级以上。
  • FSP+PS 在所有三个 Hadoop 轨迹(FB09-0、FB09-1、FB10)中均显著优于 PS 和 FIFO,尤其在高负载和高估计误差条件下表现更优。
  • FSP+FIFO 调度器表现出较高的方差和偶尔的异常性能,这是由于严重低估导致长作业过早被调度,从而阻塞了系统进度。
  • 在无估计误差的情况下,FSP 和 SRPT 的表现几乎完全相同,证实了 FSP 的公平性保证几乎不会带来平均停留时间的额外成本。
  • 当系统负载超过 1.0 后,不同调度器之间的性能差异缩小,表明在极端拥塞下基于大小的策略收益递减。
  • d/n 参数对整体性能影响极小,表明调度结果对作业大小分布偏度变化具有高度鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。