Skip to main content
QUICK REVIEW

[论文解读] Characterizing Co-located Datacenter Workloads: An Alibaba Case Study

Yue Cheng, Zheng Chai|arXiv (Cornell University)|Aug 8, 2018
Cloud Computing and Resource Management参考文献 35被引用 4
一句话总结

本文分析了阿里巴巴公开的共置数据中心工作负载追踪数据,对1,313台机器上长期运行的容器化生产作业与临时批处理作业之间的交互进行了表征。研究揭示了诸如慢启动者(stragglers)和资源过度承诺等持续性问题,同时突出了高利用率下性能干扰现象,并强调需要更协调的全局调度器以优化异构集群中的共置效率。

ABSTRACT

Warehouse-scale cloud datacenters co-locate workloads with different and often complementary characteristics for improved resource utilization. To better understand the challenges in managing such intricate, heterogeneous workloads while providing quality-assured resource orchestration and user experience, we analyze Alibaba's co-located workload trace, the first publicly available dataset with precise information about the category of each job. Two types of workload---long-running, user-facing, containerized production jobs, and transient, highly dynamic, non-containerized, and non-production batch jobs---are running on a shared cluster of 1313 machines. Our multifaceted analysis reveals insights that we believe are useful for system designers and IT practitioners working on cluster management systems.

研究动机与目标

  • 理解真实世界仓库规模数据中心中长期运行的容器化作业与临时批处理作业之间复杂交互及资源动态。
  • 识别共置环境中持续存在的挑战,如慢启动者行为和资源预测不准确。
  • 评估高利用率和工作负载异构性导致的资源竞争与性能干扰的影响。
  • 评估现有调度器(Sigma 和 Fuxi)在管理共置工作负载方面的有效性,并识别协调方面的缺口。
  • 为系统设计者和 IT 实践人员提供关于实现高效、共置优化集群管理所需架构改进的参考。

提出的方法

  • 分析阿里巴巴生产集群中公开的24小时追踪数据,包含1,313台机器的精确作业类别标签。
  • 将集群划分为“仅批处理”和“共置”区域,以对比资源使用和利用率模式。
  • 在不同资源使用范围内测量 CPU 和内存利用率、CPI 以及 MPKI,以检测性能干扰。
  • 分析资源请求、预留和实际使用模式,以识别过度预订、过度配置和过度承诺行为。
  • 评估工作负载动态性、慢启动者频率以及长期运行与批处理工作负载之间的干扰。
  • 提出应由全局 Level-0 控制器通过暴露共置工作负载带来的资源异构性,来协调各调度器。

实验结果

研究问题

  • RQ1在共置集群中,长期运行的容器化作业与临时批处理作业的资源使用模式有何不同?
  • RQ2在现代共置数据中心环境中,性能干扰和慢启动者问题在多大程度上仍然持续存在?
  • RQ3‘仅批处理’区域的资源利用率与‘共置’区域相比如何?这反映了调度器对资源异构性的认知程度如何?
  • RQ4高 CPU 和内存利用率对 CPI 和 MPKI 等性能指标有何影响?
  • RQ5如何通过全局控制器改善两级集群管理架构中工作负载专用调度器之间的协调?

主要发现

  • 长期运行的作业更依赖内存,导致整体集群内存利用率高于 CPU 利用率。
  • 为长期运行作业过度配置资源,为批处理作业弹性地过度承诺闲置资源创造了显著机会。
  • 尽管调度技术有所进步,批处理工作负载中的慢启动者问题依然存在,表明预测与资源管理方面仍存在持续挑战。
  • 在高资源利用率下,性能干扰显著加剧:CPI 和 MPKI 的峰值分别出现在 CPU 使用率 40% 以上和内存使用率 80% 以上时。
  • Fuxi(批处理调度器)假设资源池是同质的,未考虑长期运行作业引入的资源异构性。
  • Sigma(长期运行)与 Fuxi(批处理)调度器之间缺乏协调,表明需要一个更集成、具备共置感知能力的全局控制器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。