Skip to main content
QUICK REVIEW

[论文解读] Practical Size-based Scheduling for MapReduce Workloads

Mario Pastorelli, Barbuzzi, Antonio|arXiv (Cornell University)|Feb 12, 2013
Cloud Computing and Resource Management参考文献 26被引用 11
一句话总结

本文提出 HFSP,一种实用的基于大小的抢占式 Hadoop 调度器,可在执行过程中动态估算作业大小,并通过积极抢占来最小化作业驻留时间。在真实工作负载轨迹上的评估表明,与 FIFO 和 FAIR 调度器相比,HFSP 显著减少了平均作业驻留时间,在共享的多租户集群中实现了更好的公平性和资源利用率。

ABSTRACT

We present the Hadoop Fair Sojourn Protocol (HFSP) scheduler, which implements a size-based scheduling discipline for Hadoop. The benefits of size-based scheduling disciplines are well recognized in a variety of contexts (computer networks, operating systems, etc...), yet, their practical implementation for a system such as Hadoop raises a number of important challenges. With HFSP, which is available as an open-source project, we address issues related to job size estimation, resource management and study the effects of a variety of preemption strategies. Although the architecture underlying HFSP is suitable for any size-based scheduling discipline, in this work we revisit and extend the Fair Sojourn Protocol, which solves problems related to job starvation that affect FIFO, Processor Sharing and a range of size-based disciplines. Our experiments, in which we compare HFSP to standard Hadoop schedulers, pinpoint at a significant decrease in average job sojourn times - a metric that accounts for the total time a job spends in the system, including waiting and serving times - for realistic workloads that we generate according to production traces available in literature.

研究动机与目标

  • 为解决以小型迭代作业为主导的 Hadoop 工作负载中日益增长的交互性需求。
  • 在不牺牲公平性或集群利用率的前提下,减少作业驻留时间——即作业等待和执行的总时间。
  • 设计一种实用的基于大小的调度系统,其中作业大小在事先未知。
  • 实现一种避免杀死任务的抢占机制,从而支持高效恢复并减少浪费的工作量。
  • 使用真实、基于轨迹的工作负载,将 HFSP 与生产标准调度器(FIFO 和 FAIR)进行对比评估。

提出的方法

  • HFSP 使用可插拔的作业大小估算器,基于任务进度和任务执行时间的统计建模来推断作业大小。
  • 它实现了修改后的公平驻留协议,以优先处理小型作业并防止饥饿,确保低驻留时间。
  • 调度器采用积极抢占原语,允许中断和恢复正在运行的作业,从而最小化资源浪费。
  • 资源分配根据估算的作业大小和当前集群负载动态调整。
  • 该系统被设计为模块化、开源的 Hadoop 插件,可与现有 Hadoop 部署无缝集成。
  • 使用生产环境中的工作负载轨迹生成真实的工作负载用于评估。

实验结果

研究问题

  • RQ1在事先未知作业大小的情况下,基于大小的抢占式调度机制是否能显著减少 Hadoop 中的平均作业驻留时间?
  • RQ2在真实工作负载下,HFSP 与标准 Hadoop 调度器(FIFO 和 FAIR)相比,在驻留时间和资源利用率方面表现如何?
  • RQ3积极抢占与任务杀死相比,对系统效率和作业完成时间的影响是什么?
  • RQ4当作业大小事先未知时,动态作业大小估算在改善调度决策方面的有效性如何?
  • RQ5HFSP 是否能在优先处理小型交互式作业的同时,维持作业之间的公平性?

主要发现

  • 在真实、生产级别的工作负载下,HFSP 相较于 FIFO 和 FAIR 调度器,显著减少了平均作业驻留时间。
  • 驻留时间的减少在小型和中型作业中最为明显,这些作业因基于大小的优先级而获得了极低的等待时间。
  • 即使在高负载下,HFSP 也能实现高集群利用率,展现出高效的资源管理能力。
  • 与任务杀死相比,积极抢占通过减少浪费的工作量并加快被中断作业的恢复速度,表现出更优的性能。
  • 动态大小估算模块通过利用任务进度和统计模型,有效预测了作业持续时间,从而支持及时的调度决策。
  • 开源的 HFSP 调度器可直接部署于真实 Hadoop 集群,并与现有 Hadoop 组件无缝集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。