Skip to main content
QUICK REVIEW

[论文解读] A Generalized Performance Evaluation Framework for Parallel Systems with Output Synchronization

Wasiur R. KhudaBukhsh, Sounak Kar|arXiv (Cornell University)|Dec 16, 2016
Cloud Computing and Resource Management参考文献 23被引用 3
一句话总结

本文提出了一种广义的半马氏更新过程框架,用于评估具有输出同步的并行系统中的性能,重点在于对工作保持型和阻塞型服务器的稳态等待时间尾部概率进行上界估计。通过鞅技术推导出可计算的上界,并将其应用于更新过程以外的到达过程、相型服务行为以及马氏调制系统,通过仿真和真实数据校准得到验证。

ABSTRACT

Frameworks, such as MapReduce and Hadoop are abundant nowadays. They seek to reap benefits of parallelization, albeit subject to a synchronization constraint at the output. Fork-Join (FJ) queuing models are used to analyze such systems. Arriving jobs are split into tasks each of which is mapped to exactly one server. A job leaves the system when all of its tasks are executed. As a metric of performance, we consider waiting times for both work-conserving and non-work conserving server systems under a mathematical set-up general enough to take into account possible phase-type behavior of the servers, and as suggested by recent evidences, bursty arrivals. To this end, we present a Markov-additive process framework for an FJ system and provide computable bounds on tail probabilities of steady-state waiting times, for both types of servers separately. We apply our results to three scenarios, namely, non-renewal (Markov-modulated) arrivals, servers showing phase-type behavior, and Markov-modulated arrivals and services. We compare our bounds against estimates obtained through simulations and also provide a theoretical conceptualization of provisions in FJ systems. Finally, we calibrate our model with real data traces, and illustrate how our bounds can be used to devise provisions.

研究动机与目标

  • 为解决具有输出同步的并行系统中的性能评估挑战,其中任务完成依赖于所有子任务均已完成。
  • 对突发性到达和依赖性服务时间等复杂系统行为进行建模,这些行为无法通过标准的更新过程和独立同分布假设来捕捉。
  • 构建一个统一的数学框架,以处理非更新过程的到达、相型服务分布以及马氏调制的输入与服务。
  • 提供稳态等待时间尾部概率的可计算上界,以支持性能保障和系统设计。
  • 在该框架内构想并应用反应式与主动式保障机制,用于此类系统的动态负载管理。

提出的方法

  • 作者使用半马氏更新过程(MAP)对系统进行建模,以捕捉到达和服​​务时间的状态相关动态。
  • 基于矩生成函数和转移核的谱性质,采用基于鞅的方法来界定尾部概率。
  • 该框架利用Perron-Frobenius定理处理不可数状态空间,以确保主导特征值及其对应特征函数的存在性与正性。
  • 关键组成部分包括归一化的右特征函数 $ r(c, \theta) $、累积量函数 $ \zeta_k(s) $ 以及用于界定尾部事件的本性Essential Supremum $ \phi(s) $。
  • 该方法对鞅 $ M_k(s) = \exp(sY_k - k\zeta(s))r(C_k,s) $ 应用Doob的最大不等式,从而导出等待时间尾部概率的指数上界。
  • 该方法已基于真实数据轨迹进行校准,并应用于三种场景:马氏调制的到达、相型服务以及联合的马氏调制到达与服务。

实验结果

研究问题

  • RQ1如何为具有输出同步的并行系统,在非更新过程和依赖性到达/服务过程下,构建一个广义的性能评估框架?
  • RQ2在工作保持型和阻塞型服务器模型中,稳态等待时间尾部概率的可计算上界是什么?
  • RQ3如何将半马氏更新过程框架特化以建模突发性到达和相型服务行为?
  • RQ4理论上的上界如何与仿真得到的经验估计值进行对比验证?
  • RQ5如何在该框架内构想并应用反应式与主动式保障机制以实现性能优化?

主要发现

  • 该框架通过鞅技术和谱分析,为工作保持型和阻塞型服务器的稳态等待时间尾部概率提供了可计算的上界。
  • 对于独立同分布的指数服务时间(速率为 $ \mu_i $),等待时间 $ V $ 的矩生成函数为 $ \mathrm{E}[e^{\theta V}] = \sum_{S \neq \emptyset} (-1)^{|S|+1} \frac{\sum_{i \in S} \mu_i}{\sum_{i \in S} \mu_i - \theta} $,且期望等待时间为 $ \mathrm{E}[V] = \sum_{S \neq \emptyset} (-1)^{|S|+1} \frac{1}{\sum_{i \in S} \mu_i} $。
  • 在所有三种应用场景中,理论上的尾部概率上界与仿真所得的经验互补累积分布函数(CCDF)高度吻合。
  • 该模型已成功校准至真实数据轨迹,展示了其在系统性能保障方面的实际适用性。
  • 该框架支持对反应式与主动式保障机制的构想,文中以一个简单示例说明了反应式保障机制的实现。
  • 所推导的上界在性能评估中被证明是有效的,可指导复杂且现实的流量与服务模式下的系统设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。