Skip to main content
QUICK REVIEW

[论文解读] Affinity Scheduling and the Applications on Data Center Scheduling with Data Locality

Mohammadamir Kavousi|arXiv (Cornell University)|May 9, 2017
Cloud Computing and Resource Management参考文献 2被引用 4
一句话总结

本文提出了一种针对具有三级数据局部性(本地、机架本地、远程)的数据中心的加权工作量路由与优先级调度算法,确保吞吐量和重载最优性。该文证明了该算法在容量区域内的任意到达率下均可稳定系统,并在高负载下最小化平均任务完成时间,优于现有的基于启发式的方案(如Delay Scheduling和Quincy)。

ABSTRACT

MapReduce framework is the de facto standard in Hadoop. Considering the data locality in data centers, the load balancing problem of map tasks is a special case of affinity scheduling problem. There is a huge body of work on affinity scheduling, proposing heuristic algorithms which try to increase data locality in data centers like Delay Scheduling and Quincy. However, not enough attention has been put on theoretical guarantees on throughput and delay optimality of such algorithms. In this work, we present and compare different algorithms and discuss their shortcoming and strengths. To the best of our knowledge, most data centers are using static load balancing algorithms which are not efficient in any ways and results in wasting the resources and causing unnecessary delays for users.

研究动机与目标

  • 解决现有基于启发式的数据中心数据局部性调度算法缺乏理论保证的问题。
  • 分析并比较实时调度算法在具有多个数据局部性级别(本地、机架本地、远程)的系统中的吞吐量与延迟最优性。
  • 设计一种调度算法,确保系统稳定(吞吐量最优)并在高负载下最小化平均任务完成时间(重载最优)。
  • 通过李雅普诺夫漂移与流体模型分析,正式证明所提算法的最优性特性。
  • 证明现有算法(如Pandas和JSQ-MaxWeight)在三级数据局部性环境下无法维持最优性。

提出的方法

  • 采用离散时间排队模型,其中M台服务器被划分为K个机架,每类任务对应存储在一组三台服务器上的数据块。
  • 将服务时间建模为几何分布:本地(Geo(α))、机架本地(Geo(β))和远程(Geo(γ));其中 α > β > γ。
  • 定义每台服务器的加权工作量为 Wₘ(t) = Qₘˡ(t)/α + Qₘᵏ(t)/β + Qₘʳ(t)/γ,表示排队任务的预期服务延迟。
  • 实施加权工作量路由:新任务选择加权工作量最小的服务器加入,同时考虑数据局部性级别。
  • 应用优先级调度:空闲服务器优先处理本地任务,其次机架本地任务,最后远程任务,以确保局部性偏好。
  • 使用李雅普诺夫函数 V(t) = Σₘ (Wₘ(t))²,通过Foster-Lyapunov稳定性定理证明吞吐量最优性。

实验结果

研究问题

  • RQ1在具有三级数据局部性的数据中心中,是否存在一种调度算法能够同时实现吞吐量最优与重载最优?
  • RQ2现有基于启发式的算法(如Delay Scheduling和Quincy)在理论最优性保证方面表现如何?
  • RQ3为何两级数据局部性算法(如Pandas和JSQ-MaxWeight)在三级设置下无法维持最优性?
  • RQ4加权工作量路由与优先级调度算法在何种条件下实现重载最优?
  • RQ5能否设计一种统一的调度框架,确保在所有负载范围内系统稳定且延迟最小?

主要发现

  • 所提出的加权工作量路由与优先级调度算法被证明具有吞吐量最优性,可在容量区域内的任意到达率向量下稳定系统。
  • 当 β² > αγ 时,该算法实现重载最优性,即在系统趋近容量时最小化平均任务完成时间。
  • 扩展的JSQ-MaxWeight算法具有吞吐量最优性,但在所有流量场景下并非重载最优。
  • Pandas算法在两级数据局部性下表现最优,但在三级设置下无法保持吞吐量最优性。
  • 现有基于启发式的算法(如Delay Scheduling和Quincy)在吞吐量与延迟最优性方面缺乏理论保证。
  • 所提算法在高负载条件下优于以往方法,确保了系统稳定与最小延迟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。