Skip to main content
QUICK REVIEW

[논문 리뷰] Serifos: Workload Consolidation and Load Balancing for SSD Based Cloud Storage Systems

Zhihao Yao, Ioannis Papapanagiotou|arXiv (Cornell University)|2015. 12. 20.
Advanced Data Storage Technologies참고 문헌 12인용 수 4
한 줄 요약

Serifos는 I/O 지연 시간을 예측하고 최소화하기 위해 하드웨어 인식 성능 모델링을 사용하는 SSD 기반 클라우드 스토리지용 자율적 워크로드 통합 및 로드 밸런싱 시스템이다. 왕쓰비트 비율과 블록 크기를 기반으로 한 선형 회귀 모델을 활용하여 Serifos는 평균 지연 시간 변동성을 82% 감소시키고, 최대 왕쓰비트 지연 시간 기준으로 지원 가능한 SLO를 최대 63% 향상시킨다.

ABSTRACT

Achieving high performance in virtualized data centers requires both deploying high throughput storage clusters, i.e. based on Solid State Disks (SSDs), as well as optimally consolidating the workloads across storage nodes. Nowadays, the only practical solution for cloud storage providers to offer guaranteed performance is to grossly over-provision the storage nodes. The current workload scheduling mechanisms used in production do not have the intelligence to optimally allocate block storage volumes based on the performance of SSDs. In this paper, we introduce Serifos, an autonomous performance modeling and load balancing system designed for SSD-based cloud storage. Serifos takes into account the characteristics of the SSD storage units and constructs hardware dependent workload consolidation models. Thus Serifos is able to predict the latency caused by workload interference and the average latency of concurrent workloads. Furthermore, Serifos leverages an I/O load balancing algorithm to dynamically balance the volumes across the cluster. Experimental results indicate that Serifos consolidation model is able to maintain the mean prediction error of around 10% for heterogeneous hardware. As a result of Serifos load balancing, we found that the variance and the maximum average latency are reduced by 82% and 52%, respectively. The supported Service Level Objectives (SLOs) on the testbed improve 43% on average latency, 32% on the maximum read and 63% on the maximum write latency.

연구 동기 및 목표

  • 현재 시스템(예: OpenStack Cinder)이 가용 용량만 고려하는 것에 비해, SSD 기반 클라우드 스토리지에서 성능 인식 워크로드 스케줄링의 부족을 해결한다.
  • 쓰기 증폭 및 쓰기 정제와 같은 SSD 고유의 행동과 워크로드 간섭으로 인한 성능 저하를 극복한다.
  • 동시 워크로드 하에서의 집합적 지연 시간을 정확하게 예측하여 동적 성능 기반 로드 밸런싱을 지원한다.
  • 이질적인 SSD 하드웨어 전반에서 평균 지연 시간, 99번째 백분율 지연 시간, 최대 지연 시간을 감소시켜 서비스 수준 목표(SLO) 이행률을 향상시킨다.
  • 핫스팟을 방지하고 다중 테넌트 환경에서 일관된 성능을 보장하기 위해 확장 가능하고 자율적인 시스템을 설계한다.

제안 방법

  • 쓰기 비율과 블록 크기를 핵심 입력 특성으로 사용하여 하드웨어에 의존하는 워크로드 통합 모델을 선형 회귀를 기반으로 수립한다.
  • 이질적인 SSD 하드웨어에서 6개의 별도 통합 모델을 훈련시켜 동시 워크로드 하에서 호스트 전체 평균 지연 시간을 예측한다.
  • 예측 결과를 기반으로 스토리지 볼륨을 호스트 간에 동적 마이그레이션할 수 있도록 I/O 로드 밸런싱 엔진을 통합한다.
  • I/O 로드를 균형 잡고 시스템 전체 지연 시간 변동성과 최대 지연 시간을 최소화하기 위해 워크로드를 동적으로 재할당한다.
  • 이동 비용 대비 성능 향상 여부를 판단하기 위해 성능 예측 결과를 의사결정 기준으로 사용하여 성능 저하를 방지한다.
  • 다양한 워크로드와 하드웨어 유형을 포함한 실제 SSD 기반 테스트베드에서 시스템을 평가하여 모델 정확성과 로드 밸런싱 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1공유된 SSD 스토리지 호스트에서 하드웨어 인식 워크로드 통합 모델이 집합적 I/O 지연 시간을 정확하게 예측할 수 있는가?
  • RQ2이질적인 SSD 클러스터에서 동적 로드 밸런싱은 지연 시간 변동성과 최대 지연 시간을 얼마나 효과적으로 감소시키는가?
  • RQ3기본 스케줄링 메커니즘 대비 Serifos는 서비스 수준 목표(SLO)를 얼마나 향상시킬 수 있는가?
  • RQ4워크로드 간섭은 성능에 어떤 영향을 미치며, 지능적인 통합 및 마이그레이션을 통해 이를 완화할 수 있는가?
  • RQ5SSD 기반 스토리지 시스템에서 이동 비용과 성능 향상 간의 상충 관계는 어떠한가?

주요 결과

  • Serifos는 이질적인 SSD 하드웨어 전반에서 워크로드 통합에 대해 약 10%의 평균 예측 오차를 달성한다.
  • I/O 로드 밸런싱 구성요소는 OpenStack Cinder의 기본 스케줄러 대비 시스템 전체 평균 지연 시간 변동성을 82% 감소시킨다.
  • 로드 밸런싱 적용 후 최대 평균 지연 시간이 12.39ms에서 5.95ms로 52% 감소한다.
  • 시스템은 평균 지연 시간 기준으로 SLO 지원을 평균 43% 향상시키며, 최대 읽기 지연 시간 기준 32%, 최대 쓰기 지연 시간 기준 63% 향상시킨다.
  • 읽기 및 쓰기 지연 시간의 99번째 백분율은 각각 71%와 84% 감소하여 尾(꼬리) 지연 시간 성능 향상이 확인된다.
  • 로드 밸런서는 과부하 및 경부하 스토리지 호스트를 성공적으로 제거하여 모든 노드에서 더 안정적이고 예측 가능한 성능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.