QUICK REVIEW
[论文解读] A simple and effective predictive resource scaling heuristic for large-scale cloud applications
Valentín Flunkert, Quentin Rebjock|arXiv (Cornell University)|Aug 3, 2020
Cloud Computing and Resource Management参考文献 23被引用 4
一句话总结
本文提出了一种简单、风险感知的预测性自动扩展启发式方法,适用于大规模云应用,利用概率工作量预测来确定最优扩展决策,同时考虑资源供应延迟和吞吐量限制。该方法在高风险规避情况下优于复杂的优化方法和基准策略,且计算成本仅为最优解的极小部分。
ABSTRACT
We propose a simple yet effective policy for the predictive auto-scaling of horizontally scalable applications running in cloud environments, where compute resources can only be added with a delay, and where the deployment throughput is limited. Our policy uses a probabilistic forecast of the workload to make scaling decisions dependent on the risk aversion of the application owner. We show in our experiments using real-world and synthetic data that this policy compares favorably to mathematically more sophisticated approaches as well as to simple benchmark policies.
研究动机与目标
- 解决在资源供应存在延迟且吞吐量受限的大规模云环境中,传统反应式自动扩展方法的局限性。
- 开发一种实用且可扩展的自动扩展策略,通过概率预测实现风险规避。
- 使用真实世界和合成数据,对所提出的启发式方法与复杂优化方法及基线策略进行评估与比较。
- 证明在高风险规避场景下(最实际相关的情境),简单启发式方法可实现接近最优的性能。
提出的方法
- 该方法利用未来工作量的概率预测来估计分位数,从而基于应用所有者的风险容忍度做出风险感知的扩展决策。
- 提出一种预测偏移技术,通过将预测值向后调整预期延迟时间,以补偿资源供应延迟。
- 扩展策略基于最小化风险感知成本函数推导得出,该函数对资源不足的惩罚远高于资源过剩。
- 通过比较调整后的预测与当前容量,计算所需的主机增加或减少量,且调整延迟等于预期供应时间。
- 该方法计算效率高,避免求解复杂的混合整数规划问题,转而使用一种能紧密逼近最优解的启发式方法。
- 该方法使用来自1,000个Amazon自动扩展组的真实世界数据以及具有强季节性模式和噪声的合成数据集进行了验证。
实验结果
研究问题
- RQ1在现实的云约束条件下,简单启发式方法能否实现与基于复杂优化的自动扩展策略相当的性能?
- RQ2在存在资源供应延迟的情况下,使用概率预测相比点预测在扩展决策上能带来多大改善?
- RQ3风险规避在多大程度上影响最优扩展策略?启发式方法能否有效捕捉这一影响?
- RQ4预测偏移技术是否能有效补偿资源供应延迟,同时最小化成本?
- RQ5与反应式和基线启发式策略相比,所提出方法在成本和可扩展性方面表现如何?
主要发现
- 预测偏移启发式方法在成本性能上可与通过数学规划获得的最优解相媲美,尤其在高风险规避情况下表现突出。
- 在具有强季节性和低噪声的合成数据集(D₁)上,该启发式方法在中位数损失和极端损失方面显著优于Max Day和Max Week基线。
- 在真实世界数据(R₁)上,该启发式方法的中位数损失高于Max Day/Week策略,但极端损失大幅降低,表明其风险管理水平更优。
- 当风险规避水平(α)较高时,特别是接近α = 0.9时,该启发式方法与最优策略的扩展模式高度一致。
- 该启发式方法的计算成本仅为完整优化所需成本的一小部分,因此适用于大规模部署。
- 该方法已具备生产环境部署条件,并已用于超过40,000个内部及外部AWS自动扩展组的自动扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。