[論文レビュー] Serifos: Workload Consolidation and Load Balancing for SSD Based Cloud Storage Systems
Serifos は、I/O ラテンシを予測し、最小限に抑えるためにハードウェアに配慮したパフォーマンスモデルを用いる、SSD ベースのクラウドストレージ向けの自律的ワークロード統合およびロードバランシングシステムである。書き込みレートとブロックサイズに基づく線形回帰モデルを活用することで、平均ラテンシ分散を 82% 減少させ、最大書き込みラテンシにおいては、SLO 対応能力を最大 63% 向上させた。
Achieving high performance in virtualized data centers requires both deploying high throughput storage clusters, i.e. based on Solid State Disks (SSDs), as well as optimally consolidating the workloads across storage nodes. Nowadays, the only practical solution for cloud storage providers to offer guaranteed performance is to grossly over-provision the storage nodes. The current workload scheduling mechanisms used in production do not have the intelligence to optimally allocate block storage volumes based on the performance of SSDs. In this paper, we introduce Serifos, an autonomous performance modeling and load balancing system designed for SSD-based cloud storage. Serifos takes into account the characteristics of the SSD storage units and constructs hardware dependent workload consolidation models. Thus Serifos is able to predict the latency caused by workload interference and the average latency of concurrent workloads. Furthermore, Serifos leverages an I/O load balancing algorithm to dynamically balance the volumes across the cluster. Experimental results indicate that Serifos consolidation model is able to maintain the mean prediction error of around 10% for heterogeneous hardware. As a result of Serifos load balancing, we found that the variance and the maximum average latency are reduced by 82% and 52%, respectively. The supported Service Level Objectives (SLOs) on the testbed improve 43% on average latency, 32% on the maximum read and 63% on the maximum write latency.
研究の動機と目的
- 現在のシステム(例:OpenStack Cinder)が利用可能な容量のみを考慮するのに対し、SSD ベースのクラウドストレージにおけるパフォーマンスに配慮したワークロードスケジューリングの欠如に対処すること。
- ガーヴェージコレクションや書き込みアンプリフィケーションなどの SSD 特有の動作に加え、ワークロード干渉によるパフォーマンス劣化を克服すること。
- 並列ワークロード下での集計ラテンシを正確に予測し、動的でパフォーマンス駆動のロードバランシングを可能にすること。
- 多様な SSD 硬貨上で平均ラテンシ、99 パーセンタイルラテンシ、最大ラテンシを低減することで、サービスレベルオブジェクティブ(SLO)の遵守を向上させること。
- スケーラブルで自律的なシステムを設計し、I/O ワーケンロードを動的にバランスさせ、ホットスポットを防ぎ、マルチテナント環境における一貫性のあるパフォーマンスを確保すること。
提案手法
- 書き込みレートとブロックサイズを主な入力特徴とする線形回帰モデルを用いて、ハードウェア依存のワークロード統合モデルを構築する。
- 多様な SSD 硬貨上で、並列ワークロード下でのホスト全体の平均ラテンシを予測するための 6 種類の統合モデルをトレーニングする。
- 予測結果を活用してストレージボリュームをホスト間で動的に移行する I/O ロードバランシングエンジンを統合する。
- I/O ロードをバランスさせ、システム全体のラテンシ分散と最大ラテンシを最小化するため、ワークロードを動的に再割り当てる。
- 移行の恩恵がコストを上回ることを保証するため、パフォーマンス予測を意思決定基準として使用する。
- 多様なワークロードとハードウェアタイプを用いた実際の SSD ベースのテストベッド上で、モデルの正確性とロードバランシングの有効性を検証する。
実験結果
リサーチクエスチョン
- RQ1共有 SSD ストレージホスト上での集計 I/O ラテンシを、ハードウェアに配慮したワークロード統合モデルが正確に予測できるか?
- RQ2異種 SSD クラスタ上で動的ロードバランシングは、ラテンシ分散と最大ラテンシをどの程度低減できるか?
- RQ3デフォルトスケジューリングメカニズムと比較して、Serifos はどの程度 SLO 対応能力を向上させられるか?
- RQ4ワークロード干渉はパフォーマンスにどのような影響を与えるか、そして知的な統合と移行によってこれを緩和できるか?
- RQ5SSD ベースのストレージシステムにおいて、移行コストとパフォーマンス向上のトレードオフはどのようなものか?
主な発見
- Serifos は、異種 SSD 硬貨上でのワークロード統合において、平均予測誤差が約 10% に抑えられた。
- I/O ロードバランシング部は、OpenStack Cinder のデフォルトスケジューラと比較して、システム全体の平均ラテンシ分散を 82% 減少させた。
- ロードバランシングを適用した後、最大平均ラテンシは 12.39ms から 5.95ms に 52% 減少した。
- システムは、平均ラテンシで 43%、最大読み取りラテンシで 32%、最大書き込みラテンシで 63% の SLO 対応能力を向上させた。
- 読み取りと書き込みラテンシの 99 パーセンタイルは、それぞれ 71% と 84% 減少し、尾部ラテンシのパフォーマンス向上が示された。
- ロードバランサは過負荷および未利用のストレージホストを効果的に排除し、すべてのノードでより安定的かつ予測可能なパフォーマンスを実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。