[논문 리뷰] Understanding the Performance of Ceph Block Storage for Hyper-Converged Cloud with All Flash Storage
이 논문은 올플래시 하이퍼컨버지드 클라우드 환경에서 Ceph 블록 스토리지의 성능을 평가하며, 마이크로벤치마크 결과, 배포 과제, 그리고 5년간의 총소유비용(TCO) 모델을 제시한다. 하이퍼컨버지드 아키텍처가 전용 스토리지 대비 인프라 비용을 최대 2배까지 절감할 수 있음을 입증하며, 특히 규모가 크고 활용도가 낮을 경우에 유리하다.
Hyper-converged cloud refers to an architecture that an operator runs compute and storage services on the same set of physical servers. Although the hyper-converged design comes with a number of benefits, it makes crucial operational tasks, such as capacity planning and cost analysis, fairly complicated. The problem becomes more onerous if we consider a complex distributed system, such as Ceph, for the cloud with the proliferation of SSD drives. In this paper, we aim to answer some of these questions based on comprehensive microbenchmarks, and consequently better understand the behavior of Ceph in a hyper-converged cloud with all-flash storage. We reported our findings based on the study, devised a cost model and compared the cost of hyper-converged architecture with dedicated storage architecture. Additionally we summarized our experience based on the interactions with many teams at AT&T in the past couple of years.
연구 동기 및 목표
- 모든 플래시 하이퍼컨버지드 클라우드 워크로드에서 Ceph 블록 스토리지의 성능 저하 원인을 이해하기 위해.
- 읽기 및 왤기 I/O 작업 동안 시스템 자원 소비(CPU, 메모리, 네트워크)를 정량화하기 위해.
- 5년간 TCO 기준으로 하이퍼컨버지드 및 전용 스토리지 아키텍처를 비교하는 실용적인 비용 모델을 개발하기 위해.
- 생산 데이터센터에서 소프트웨어 정의 스토리지 도입 시 발생하는 실제 배포 과제를 문서화하기 위해.
- 모든 플래시 하이퍼컨버지드 클라우드 배포에 대한 비용 효율적인 결정을 내리는 데 도움이 되는 인프라 아키텍트를 위한 가이드라인 제공하기 위해.
제안 방법
- 모든 플래시 스토리지로 구성된 전용 Ceph 클러스터에서 마이크로벤치마크를 실시하여 I/O 성능 및 자원 활용도를 측정하였다.
- 읽기 및 왼기 작업 간 비대칭적인 자원 소비를 분석하여 CPU 및 스토리지 데몬이 주요 성능 저하 원인임을 규명하였다.
- 하이퍼컨버지드 및 전용 스토리지 구성에 대해 하드웨어, 소프트웨어, 지원, 전력/냉각, 운영 비용을 포함한 5년간 TCO 모델을 개발하였다.
- 비용 가정 및 모델 파rameter 검증을 위해 AT&T 내부 배포에서 수집한 실제 데이터를 활용하였다.
- 스토리지 대 컴퓨팅 비율(10%에서 70%까지) 변화가 비용 효율성과 성능에 미치는 영향을 평가하였다.
- 0에서 500개의 데이터센터에 걸쳐 비용 추세를 예측하여 하이퍼컨버지드 아키텍처의 확장성 이점을 평가하였다.
실험 결과
연구 질문
- RQ1모든 플래시 하이퍼컨버지드 클라우드 워크로드에서 Ceph 블록 스토리지의 성능 저하 원인은 어디에 존재하는가?
- RQ2Ceph에서 읽기 및 왼기 I/O 작업은 CPU, 메모리, 네트워크 자원을 어떻게 비대칭적으로 소비하는가?
- RQ35년간 하이퍼컨버지드 및 전용 스토리지 아키텍처 간 총소유비용(TCO)의 차이는 얼마인가?
- RQ4하이퍼컨버지드 스토리지의 비용 효율성은 데이터센터 수와 다양한 스토리지 대 컴퓨팅 비율에 따라 어떻게 변화하는가?
- RQ5생산 데이터센터에서 Ceph와 같은 소프트웨어 정의 스토리지 배포 시 발생하는 운영 과제는 무엇인가?
주요 결과
- 모든 플래시 스토리지 환경에서 Ceph의 성능 저하 원인은 고성능 IOPS 및 일致성 보장로 인해 디스크 I/O에서 CPU, 네트워크, 스토리지 데몬으로 이동하였다.
- Ceph 스토리지 풀 설정에서 복제 및 저널링 오버헤드로 인해 왼기 I/O 작업은 읽기 I/O 대비 최대 9배의 CPU 자원을 소비하였다.
- 하이퍼컨버지드 아키텍처는 전체 시스템 활용도가 낮을 경우 하드웨어 조달 비용을 크게 절감할 수 있었다.
- 규모가 큰 경우(예: 500개의 데이터센터), 하이퍼컨버지드 모델은 전용 스토리지 대비 TCO를 최대 2배까지 절감할 수 있었으며, 주로 서버 및 인프라 비용 절감 덕분이었다.
- NVMe SSD는 연구된 워크로드에서는 과도한 투자로 판명되어, 많은 하이퍼컨버지드 워크로드에 대해 비용 효율적인 SSD로도 충분할 수 있음을 시사하였다.
- 생산 환경에서 소프트웨어 정의 스토리지 배포에는 신뢰성, 보안, 백업, 모니터링 분야에서 광범위한 노력이 필요하며, 각 문제 해결에 상당한 시간이 소요됨을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.