Skip to main content
QUICK REVIEW

[论文解读] Understanding the Performance of Ceph Block Storage for Hyper-Converged Cloud with All Flash Storage

Moo-Ryong Ra|arXiv (Cornell University)|Feb 22, 2018
Advanced Data Storage Technologies参考文献 4被引用 4
一句话总结

本文评估了全闪存在超融合云环境中的Ceph块存储,展示了微基准测试结果、部署挑战以及一个5年总拥有成本(TCO)模型。结果表明,与专用存储相比,超融合架构可将基础设施成本降低多达2倍,尤其在大规模部署和低利用率情况下效果显著。

ABSTRACT

Hyper-converged cloud refers to an architecture that an operator runs compute and storage services on the same set of physical servers. Although the hyper-converged design comes with a number of benefits, it makes crucial operational tasks, such as capacity planning and cost analysis, fairly complicated. The problem becomes more onerous if we consider a complex distributed system, such as Ceph, for the cloud with the proliferation of SSD drives. In this paper, we aim to answer some of these questions based on comprehensive microbenchmarks, and consequently better understand the behavior of Ceph in a hyper-converged cloud with all-flash storage. We reported our findings based on the study, devised a cost model and compared the cost of hyper-converged architecture with dedicated storage architecture. Additionally we summarized our experience based on the interactions with many teams at AT&T in the past couple of years.

研究动机与目标

  • 理解在全闪存超融合云工作负载下Ceph块存储的性能瓶颈。
  • 量化读取和写入I/O操作对系统资源(CPU、内存、网络)的消耗情况。
  • 开发一个实用的成本模型,比较5年TCO下超融合与专用存储架构的差异。
  • 记录在生产数据中心引入软件定义存储时遇到的实际部署挑战。
  • 为基础设施架构师在全闪存超融合云部署中做出成本效益更高的决策提供指导。

提出的方法

  • 在专为Ceph集群构建的全闪存存储环境中执行全面的微基准测试,以测量I/O性能和资源利用率。
  • 分析读取和写入操作之间不对称的资源消耗情况,识别出CPU和存储守护进程为关键瓶颈。
  • 开发一个5年TCO模型,整合硬件、软件、支持、供电/制冷以及运维成本,涵盖超融合与专用存储配置。
  • 使用AT&T内部部署的真实数据来支持成本假设并验证模型参数。
  • 评估存储与计算比(10%至70%)变化对成本效率和性能的影响。
  • 预测0至500个数据中心范围内的成本趋势,以评估超融合设计的可扩展性优势。

实验结果

研究问题

  • RQ1在全闪存超融合云工作负载下,Ceph块存储的性能瓶颈出现在何处?
  • RQ2在Ceph中,读取和写入I/O操作如何不对称地消耗系统资源(CPU、内存、网络)?
  • RQ3在5年期间,超融合与专用存储架构之间的总拥有成本(TCO)差异是多少?
  • RQ4超融合存储的成本效率如何随数据中心数量增加以及存储与计算比变化而变化?
  • RQ5在生产数据中心中部署Ceph等软件定义存储时,会遇到哪些运维挑战?

主要发现

  • 在全闪存存储环境下,Ceph的性能瓶颈主要从磁盘I/O转移至CPU、网络以及存储守护进程,这归因于高IOPS和一致性保证。
  • 由于Ceph存储池配置中的复制和日志记录开销,写入I/O操作消耗的CPU资源最多可达读取I/O的9倍。
  • 超融合架构显著降低了硬件采购成本,尤其在整体系统利用率较低时更为明显。
  • 在大规模部署(如500个数据中心)下,与专用存储相比,超融合模型可将TCO降低最多2倍,主要得益于更低的服务器和基础设施成本。
  • 在所研究的工作负载中,NVMe SSD被发现是过度投资,表明对于许多超融合工作负载,成本效益更高的SSD可能已足够。
  • 在生产环境中部署软件定义存储需要在可靠性、安全性、备份和监控方面投入大量精力,且每个问题均需耗费大量时间解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。