Skip to main content
QUICK REVIEW

[论文解读] Network calculus for parallel processing

George Kesidis, Bhuvan Urgaonkar|arXiv (Cornell University)|Sep 2, 2014
Cloud Computing and Resource Management参考文献 14被引用 5
一句话总结

本文应用网络计算理论对并行处理系统中的延迟进行建模,特别关注MapReduce等框架中映射器(mapper)与归约器(reducer)阶段之间的同步屏障。研究建立表明,端到端延迟受各个处理路径中最大延迟的限制,通过广义随机突发性边界量化在负载均衡和服务保障条件下的性能表现。

ABSTRACT

In this note, we present preliminary results on the use of "network calculus" for parallel processing systems, specifically MapReduce.

研究动机与目标

  • 为具有同步屏障的多阶段并行处理系统开发性能模型。
  • 利用网络计算原理分析单个并行处理阶段的延迟。
  • 以单个队列延迟和突发性约束为依据,量化端到端延迟边界。
  • 使用来自Facebook数据中心的真实工作负载轨迹验证该模型。
  • 在强随机突发性假设下,为平稳且负载均衡的系统建立理论边界。

提出的方法

  • 将单阶段分流-汇聚系统建模为K个并行队列,每个队列具有服务曲线 $ s_{\min,k} $ 和到达过程 $ a_k \ll b_{\text{in},k} $。
  • 定义虚拟延迟 $ \delta_k(t) = t - a_k^{-1}(d_k(t)) $ 以表示每个队列的滞后。
  • 将系统输出 $ D(t) $ 表示为 $ A(\min_k \{ a_k^{-1}(d_k(t)) \}) $,反映最慢队列处的屏障效应。
  • 引入广义随机突发性边界(gSBB)以在平稳条件下建模随机工作负载行为。
  • 使用卷积恒等式 $ (s_{\min,k} * a_k)(t) \geq a_k(t - d_{\max,k}) $ 对每个队列的延迟进行边界限定。
  • 将延迟边界 $ d_{\max,k} $ 作为输入突发性包络 $ b_{\text{in},k} $ 与服务曲线 $ s_{\min,k} $ 之间最大水平差值。

实验结果

研究问题

  • RQ1在阶段之间存在同步屏障的并行处理系统中,端到端延迟边界是什么?
  • RQ2工作负载的强随机突发性如何影响负载均衡系统中的延迟分布?
  • RQ3网络计算能否为具有流水线式映射器-洗牌器-归约器阶段的MapReduce类系统提供一种可处理且通用的性能模型?
  • RQ4在并行队列之间进行负载均衡如何影响系统的最坏情况延迟?
  • RQ5在分流-汇聚架构中,单个队列延迟与整体系统延迟之间存在何种关系?

主要发现

  • 从输入 $ A $ 到输出 $ D $ 的端到端延迟被限制在 $ A(t - \max_k \{ d_{\max,k} \}) $ 之内,意味着系统延迟等于所有并行队列中最大延迟。
  • 在强随机突发性条件下,$ A(t) - D(t) \geq x $ 的概率被边界 $ \Phi(x - 2M \max_k \{ \varepsilon_k / \mu_k \}) $ 所限制,其中 $ \Phi $ 为递减尾部函数。
  • 该边界表明,即使在随机工作负载波动下,系统延迟仍由最慢队列主导。
  • 该模型证实,按服务容量 $ \mu_k $ 比例进行负载均衡可确保有界的偏差 $ \varepsilon_k $,从而提升延迟的可预测性。
  • 基于Facebook数据中心轨迹的数值评估验证了gSBB模型,表明推导出的边界具有紧密性。
  • 结果表明,网络计算可在极少假设条件下有效建模复杂的真实世界并行处理系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。