[论文解读] A Simulator for Data-Intensive Job Scheduling
本文提出了一种基于仿真的评估方法,用于数据密集型批处理系统中基于作业大小的调度策略,其中作业大小是估计值而非确切值。尽管存在显著的估计误差(对数正态分布,σ=1),FSP+PS 调度器始终优于 FIFO 和公平共享策略,将平均停留时间减少了一个数量级以上,并对不精确的大小预测表现出极强的鲁棒性。
Despite the fact that size-based schedulers can give excellent results in terms of both average response times and fairness, data-intensive computing execution engines generally do not employ size-based schedulers, mainly because of the fact that job size is not known a priori. In this work, we perform a simulation-based analysis of the performance of size-based schedulers when they are employed with the workload of typical data-intensive schedules and with approximated size estimations. We show results that are very promising: even when size estimation is very imprecise, response times of size-based schedulers can be definitely smaller than those of simple scheduling techniques such as processor sharing or FIFO.
研究动机与目标
- 评估在作业大小事先未知的数据密集型批处理工作负载中,基于大小的调度器的可行性和性能。
- 评估大小估计误差对调度性能的影响,特别是对平均停留时间和公平性的影响。
- 在真实的工作负载轨迹和估计不确定性下,比较不同调度策略(FIFO、处理器共享(PS)、FSP 和混合型 FSP+PS)的有效性。
- 提供实证证据以支持 HFSP Hadoop 调度器的设计,利用仿真结果指导实际部署。
- 分析调度性能对系统负载和控制作业大小分布的 d/n 参数的敏感性。
提出的方法
- 作者开发了一个基于 Python 的自定义仿真器,使用 numpy 和 matplotlib,抽象出底层执行引擎的细节,专注于调度逻辑。
- 作业被建模为(到达时间,执行时间)对,执行时间来自真实 Hadoop 工作负载轨迹(FB09-0、FB09-1、FB10)。
- 大小估计误差通过对数正态分布建模:估计大小 ŝ = sX,其中 X ~ Log-N(0, σ²),从而实现可控的误差水平。
- 仿真器实现了标准调度器:FIFO、处理器共享(PS)、最短剩余处理时间(SRPT)以及基于公平性的大小策略(FSP),包括混合变体如 FSP+PS 和 FSP+FIFO。
- 性能通过平均停留时间(从提交到完成的时间)进行评估,结果在多次仿真运行中取平均以确保稳定性。
- 仿真评估了三个关键系统参数:负载(l)、估计误差(σ)以及控制作业大小分布偏度的 d/n 参数。
实验结果
研究问题
- RQ1当作业大小是估计值而非确切值时,在真实的数据密集型工作负载中,基于大小的调度器表现如何?
- RQ2将大小估计误差(建模为对数正态分布)对批处理作业调度中平均停留时间和公平性的影响是什么?
- RQ3在响应时间和对估计误差的鲁棒性方面,FSP+PS 调度器相较于 FIFO、PS 和 FSP+FIFO 的表现如何?
- RQ4系统负载如何影响基于大小与非基于大小的调度器之间的性能差距?
- RQ5调度性能对控制作业大小分布形状的 d/n 参数的敏感性如何?
主要发现
- 即使估计误差较高(σ=1),即超过 50% 的估计值偏差超过 2 倍,FSP+PS 调度器仍能将平均停留时间相比 FIFO 显著减少一个数量级以上。
- FSP+PS 在所有三个 Hadoop 轨迹(FB09-0、FB09-1、FB10)中均显著优于 PS 和 FIFO,尤其在高负载和高估计误差条件下表现更优。
- FSP+FIFO 调度器表现出较高的方差和偶尔的异常性能,这是由于严重低估导致长作业过早被调度,从而阻塞了系统进度。
- 在无估计误差的情况下,FSP 和 SRPT 的表现几乎完全相同,证实了 FSP 的公平性保证几乎不会带来平均停留时间的额外成本。
- 当系统负载超过 1.0 后,不同调度器之间的性能差异缩小,表明在极端拥塞下基于大小的策略收益递减。
- d/n 参数对整体性能影响极小,表明调度结果对作业大小分布偏度变化具有高度鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。