Skip to main content
QUICK REVIEW

[论文解读] Prediction-Based Power Oversubscription in Cloud Platforms

Alok Kumbhare, Reza Azimi|arXiv (Cornell University)|Oct 29, 2020
Cloud Computing and Resource Management参考文献 34被引用 6
一句话总结

本文提出了一种基于预测的公共云平台电源超分配框架,利用机器学习对工作负载按性能关键性进行分类,并预测95百分位CPU利用率,通过智能虚拟机(VM)放置和每虚拟机电源限制,在最小化对关键工作负载影响的前提下,实现最高2倍的超分配。

ABSTRACT

Datacenter designers rely on conservative estimates of IT equipment power draw to provision resources. This leaves resources underutilized and requires more datacenters to be built. Prior work has used power capping to shave the rare power peaks and add more servers to the datacenter, thereby oversubscribing its resources and lowering capital costs. This works well when the workloads and their server placements are known. Unfortunately, these factors are unknown in public clouds, forcing providers to limit the oversubscription so that performance is never impacted. In this paper, we argue that providers can use predictions of workload performance criticality and virtual machine (VM) resource utilization to increase oversubscription. This poses many challenges, such as identifying the performance-critical workloads from black-box VMs, creating support for criticality-aware power management, and increasing oversubscription while limiting the impact of capping. We address these challenges for the hardware and software infrastructures of Microsoft Azure. The results show that we enable a 2x increase in oversubscription with minimum impact to critical workloads.

研究动机与目标

  • 解决由于基于峰值功耗的保守配置导致的数据中心电源容量未充分利用的问题。
  • 克服传统电源限制在公共云中因工作负载类型和部署位置未知且动态变化而带来的局限性。
  • 通过智能识别和保护性能关键型工作负载,同时容忍非关键型工作负载的限制,实现更高的电源超分配。
  • 开发一种可扩展、可投入生产的系统,将预测结果集成到虚拟机放置和电源限制决策中,而无需对虚拟机进行深度检测。
  • 在最大化电源效率和成本节约的同时,将限制对关键工作负载的性能影响降至最低。

提出的方法

  • 设计一种模式匹配算法,从黑盒虚拟机中检测出反映性能关键型工作负载的昼夜利用率模式。
  • 在模式匹配算法输出的基础上训练机器学习模型,以预测工作负载的关键性及其在整个虚拟机生命周期内的95百分位CPU利用率。
  • 实施一种基于关键性和利用率的虚拟机放置策略,平衡服务器和机架之间的功耗和限制余量。
  • 开发一种基于反馈和预测的每虚拟机电源限制控制器,选择性地应用节流机制,以保护关键工作负载。
  • 将预测与控制堆栈集成到微软Azure的机器学习和预测服务基础设施中,实现生产环境使用。
  • 设计一种选择超分配水平的策略,将对关键和非关键工作负载的限制影响控制在预设阈值以内。

实验结果

研究问题

  • RQ1在无需应用层插桩的情况下,机器学习模型能否准确预测黑盒虚拟机中的工作负载关键性和高百分位CPU利用率?
  • RQ2如何利用预测结果在不降低关键工作负载性能的前提下,实现公共云平台中更高的电源超分配?
  • RQ3在基于预测关键性的每虚拟机电源限制中,超分配收益与限制影响之间的最优权衡是什么?
  • RQ4如何将每虚拟机电源限制与智能虚拟机放置策略集成到微软Azure等生产云基础设施中?
  • RQ5基于预测的技术在多大程度上可以减少过度配置的需求,同时保持服务级别保证?

主要发现

  • 所提出的系统相比传统保守配置方法,实现了2倍的电源超分配提升。
  • 与以往基于FFT的方法相比,该工作负载关键性预测的机器学习模型具有更高的准确性和鲁棒性。
  • 预测95百分位CPU利用率有助于更早预见电源预算超支,并做出更有效的限制决策。
  • 基于关键性的虚拟机放置策略通过战略性地隔离非关键工作负载,减少了限制事件的数量及其影响。
  • 即使在高电源压力下,系统仍能将对关键工作负载的性能影响保持在极低水平,满足预设的服务级别目标。
  • 该方法具备生产环境部署能力,可无缝集成到现有的Azure基础设施中,包括机器学习服务和固件级电源控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。