Skip to main content
QUICK REVIEW

[论文解读] Patterns in the Chaos - a Study of Performance Variation and Predictability in Public IaaS Clouds

Philipp Leitner, Juergen Cito|arXiv (Cornell University)|Nov 10, 2014
Cloud Computing and Resource Management参考文献 46被引用 6
一句话总结

本文通过大规模文献综述和在四个云服务提供商(AWS EC2、Google GCE、Microsoft Azure、IBM SoftLayer)上的真实世界实验,研究了公共IaaS云中的性能可预测性。该研究提出了15项关于性能差异的假设,并基于53,918次测量结果进行了验证,发现多租户环境对性能可预测性有显著影响,尤其在Azure和部分EC2实例类型中更为明显;而硬件异构性比以往认为的更为少见,且一天中不同时段或一周中不同日期的影响可忽略不计。

ABSTRACT

Benchmarking the performance of public cloud providers is a common research topic. Previous research has already extensively evaluated the performance of different cloud platforms for different use cases, and under different constraints and experiment setups. In this paper, we present a principled, large-scale literature review to collect and codify existing research regarding the predictability of performance in public Infrastructure-as-a-Service (IaaS) clouds. We formulate 15 hypotheses relating to the nature of performance variations in IaaS systems, to the factors of influence of performance variations, and how to compare different instance types. In a second step, we conduct extensive real-life experimentation on Amazon EC2 and Google Compute Engine to empirically validate those hypotheses. At the time of our research, performance in EC2 was substantially less predictable than in GCE. Further, we show that hardware heterogeneity is in practice less prevalent than anticipated by earlier research, while multi-tenancy has a dramatic impact on performance and predictability.

研究动机与目标

  • 识别公共IaaS云中性能差异的根本模式和机制。
  • 评估先前关于云性能可预测性的研究在长期有效性和普适性方面的表现。
  • 通过大规模真实世界基准测试,实证验证基于现有文献推导出的假设。
  • 评估多租户、硬件异构性、区域和时间等因素对性能稳定性与可预测性的影响。
  • 为用户和研究人员提供关于基于性能和成本效率选择最优实例类型的实用建议。

提出的方法

  • 开展系统性大规模文献综述,收集并归类现有关于IaaS性能可预测性的研究成果。
  • 基于同行评审文献,提出15项关于性能差异、影响因素和实例类型比较的假设。
  • 在四大主流IaaS提供商(AWS EC2、GCE、Azure、SoftLayer)上开展为期一个月的真实世界基准测试。
  • 执行5项微基准和应用级基准测试,配置2–8种不同组合,每日测量6次,共产生53,918次测量结果。
  • 采用统计分析方法验证假设,重点关注性能波动性、区域影响以及一天中不同时段/一周中不同日期的模式。
  • 维护一个公开的配套网站,提供所有基准代码、原始数据和分析脚本,以确保可复现性。

实验结果

研究问题

  • RQ1IaaS云中的性能差异在多大程度上源于多租户环境?这种影响在不同云服务提供商之间是否存在差异?
  • RQ2现代公共IaaS云中的硬件异构性有多普遍?它是否对性能可预测性产生显著影响?
  • RQ3一天中不同时段或一周中不同日期是否对云实例性能产生可测量的影响?
  • RQ4IaaS实例的性能在时间维度上有多稳定和可预测?这种特性在不同云服务提供商和实例类型之间有何差异?
  • RQ5先前的基准测试结果在多大程度上可推广到不同IaaS云服务提供商?还是其结果具有高度的提供商特异性?

主要发现

  • 多租户对性能可预测性有显著且可测量的影响,但该效应在不同IaaS云服务提供商之间并非均匀分布,尤其在Azure和特定EC2实例类型中表现最为明显。
  • 硬件异构性比以往报道的更为少见;仅部分EC2实例类型和Azure存在异构底层硬件,这挑战了以往认为硬件异构性广泛存在的假设。
  • 未发现性能差异与一天中不同时段或一周中不同日期之间存在统计显著相关性,表明时间模式不能作为性能的可靠预测指标。
  • 区域对性能和可预测性具有统计显著影响,不同地理区域之间的差异在各云服务提供商中均被观察到。
  • 性能可预测性和成本效率无法在不同云服务提供商之间通用;实例选择必须基于特定使用场景的基准测试,而非依赖先前研究的假设。
  • 本研究证实,云性能是一个“动态变化的目标”——某一提供商(如EC2)的研究发现无法可靠地推广到其他提供商,因此必须定期重新评估性能模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。