Skip to main content
QUICK REVIEW

[论文解读] PerfEnforce: A Dynamic Scaling Engine for Analytics with Performance Guarantees

Jennifer Ortiz, Brendan Lee|arXiv (Cornell University)|May 31, 2016
Cloud Computing and Resource Management参考文献 23被引用 5
一句话总结

PerfEnforce 是一种动态扩展引擎,通过在确保查询运行时间满足 SLA 目标的同时最小化成本,为基于云的数据分析服务保证性能 SLA。它使用感知机学习方法,在查询之间自适应地扩展虚拟机集群,相比反馈控制和强化学习,在保持低延迟和低成本的同时干扰最小。

ABSTRACT

In this paper, we present PerfEnforce, a scaling engine designed to enable cloud providers to sell performance levels for data analytics cloud services. PerfEnforce scales a cluster of virtual machines allocated to a user in a way that minimizes cost while probabilistically meeting the query runtime guarantees offered by a service level agreement. With PerfEnforce, we show how to scale a cluster in a way that minimally disrupts a user's query session. We further show when to scale the cluster using one of three methods: feedback control, reinforcement learning, or perceptron learning. We find that perceptron learning outperforms the other two methods when making cluster scaling decisions.

研究动机与目标

  • 解决在基于云的数据分析服务中提供性能保证的挑战,用户购买的是延迟 SLA 而非固定资源分配。
  • 在确保用户查询满足其 SLA 规定的运行时间目标的同时,最小化运营成本。
  • 通过使用局部共享无状态存储和部分数据复制,减少集群重新配置过程中的干扰。
  • 开发并评估能够实时适应变化查询工作负载的动态扩展策略。
  • 使云服务提供商能够基于经验性能分布提供概率性 SLA。

提出的方法

  • PerfEnforce 根据性能 SLA 要求,动态调整分配给用户的虚拟机(VM)集群规模。
  • 它采用无共享存储架构并结合部分数据复制,以实现快速集群重新配置并减少设置时间。
  • 系统评估三种扩展决策策略:反馈控制、强化学习(RL)和感知机学习(PL)。
  • 感知机学习持续根据近期查询性能更新查询时间估计值,从而实现对工作负载变化的快速适应。
  • 扩展决策可基于过去 SLA 合规性(主动)或在每次查询执行前(被动)做出。
  • 系统计算性能比(PR)和成本服务(CS)指标,将不同扩展策略与理想基线进行比较。

实验结果

研究问题

  • RQ1云分析系统如何动态扩展虚拟机集群,以在最小化成本的同时满足性能 SLA 保证?
  • RQ2在 SLA 合规性和成本方面,不同动态扩展策略——反馈控制、强化学习和感知机学习——之间的权衡是什么?
  • RQ3基于感知机的学习模型是否能在适应可变查询工作负载方面优于传统控制方法和强化学习方法?
  • RQ4部分数据复制和本地存储如何影响集群重新配置的开销和查询执行的稳定性?
  • RQ5基于经验性能分布,哪些概率性 SLA 参数可以可靠地对外宣传?

主要发现

  • 感知机学习(PL)在性能比(PR)和相对标准差分布方面最接近理想基线,优于反馈控制和强化学习。
  • 感知机学习方法实现了均值接近 1.0 且方差较低的 PR 分布,表明在各种工作负载下均表现出强大的 SLA 合规性。
  • 在 10 个随机工作负载中,感知机学习实现了 90% 分位数查询比为 1.37,意味着当 SLA 时间设置为实际估计时间的 1.37 倍时,90% 的查询满足或超过 SLA 目标。
  • 感知机学习方法无需针对每种工作负载进行复杂参数调优,而强化学习和反馈控制则需要工作负载特定的校准。
  • 该系统使云服务提供商能够以信心对外宣传概率性 SLA,例如承诺若将时间设为估计时间的 2 倍,则 90% 的查询将满足 SLA。
  • 使用本地、无共享存储并结合部分复制,显著减少了设置时间并最小化了集群重新配置期间的干扰,从而实现了快速可靠的扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。