Skip to main content
QUICK REVIEW

[論文レビュー] PACEMAKER: Avoiding HeART attacks in storage clusters with disk-adaptive redundancy

Saurabh Kadekodi, Francisco Maturana|arXiv (Cornell University)|Mar 15, 2021
Advanced Data Storage Technologies被引用数 6
ひとこと要約

PACEMAKER は、データレイアウトを知的に整理し、事前に遷移を開始することで、ストレージクラスタにおける遷移オーバーロードを解消する予防的レプリカ管理システムであり、ピークIO使用率を5%未塔に低下させながら、14–20%のストレージ節約を達成し、データ保護を損なわずに実現する。

ABSTRACT

Data redundancy provides resilience in large-scale storage clusters, but imposes significant cost overhead. Substantial space-savings can be realized by tuning redundancy schemes to observed disk failure rates. However, prior design proposals for such tuning are unusable in real-world clusters, because the IO load of transitions between schemes overwhelms the storage infrastructure (termed transition overload). This paper analyzes traces for millions of disks from production systems at Google, NetApp, and Backblaze to expose and understand transition overload as a roadblock to disk-adaptive redundancy: transition IO under existing approaches can consume 100% cluster IO continuously for several weeks. Building on the insights drawn, we present PACEMAKER, a low-overhead disk-adaptive redundancy orchestrator. PACEMAKER mitigates transition overload by (1) proactively organizing data layouts to make future transitions efficient, and (2) initiating transitions proactively in a manner that avoids urgency while not compromising on space-savings. Evaluation of PACEMAKER with traces from four large (110K-450K disks) production clusters show that the transition IO requirement decreases to never needing more than 5% cluster IO bandwidth (0.2-0.4% on average). PACEMAKER achieves this while providing overall space-savings of 14-20% and never leaving data under-protected. We also describe and experiment with an integration of PACEMAKER into HDFS.

研究の動機と目的

  • 反応的遷移が何週間もにわたりクラスタIOの100%を消費する、ディスクに適応するレプリカ管理における遷移オーバーロードという深刻な問題に対処する。
  • AFRの上昇が検出されてから急激にIO集約的な遷移を開始する従来の反応的アプローチの限界を克服する。
  • 多様なディスク配置パターン(トレイクルおよびステップ配置)にわたって、IOのオーバーヘッドを最小限に抑えながら、ストレージ節約を最大化するという実用的導入を可能にする。
  • 遷移段階中にデータ保護が不十分にならないように、常にデータの信頼性を維持する。
  • 合計の遷移IOを従来手法よりも90%以上削減できるように、予防的データ配置と遷移スケジューリングを設計する。

提案手法

  • 同じ故障率と配置パターンを持つディスクをグループ化することで、効率的なバルク遷移を可能にする、事前にデータレイアウトを再編成する。
  • パrametricな分布を仮定しない非パrametricカーネルベースのAFR推定(Epanechnikovカーネル、30日帯域幅)を用いて、故障率を追跡する。
  • 観察されたAFRトレンドに基づく予測モデルを用いて、故障率のしきい値に達する前に事前に遷移を開始する。
  • 遷移を低影響タイプに分解する:ディスクの空き化(タイプ1)、バルクパリティ再計算(タイプ2)、部分的データ移行(タイプ3)で、IO使用率が低い処理を優先する。
  • クラスタ帯域幅の5%以内に遷移IOを制限するために、活動が少ない時期に遷移をスケジューリングし、ワークロードを均等に分散する。
  • HDFSに統合することで実世界での実現可能性を実証し、生産環境に近い環境でのエンドツーエンドのパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1ディスクに適応するレプリカ管理システムにおける遷移オーバーロードの原因は何か? なぜ従来の反応的アプローチは実世界のクラスタで失敗するのか?
  • RQ2異なるディスク配置パターン(トレイクル対ステップ配置)は、レプリカ遷移のIOコストとタイミングにどのように影響するか?
  • RQ3予防的データレイアウトと遷移スケジューリングにより、合計の遷移IOを削減しながら、データの信頼性を維持し、顕著なストレージ節約を達成できるか?
  • RQ4データ保護を損なわずに耐えられる最大のIOオーバーヘッドは何か? そして、それをどのように強制できるか?
  • RQ5異なるディスク集団と故障率行動を示す生産規模のクラスタにおいて、本システムはどのように動作するか?

主な発見

  • 遷移オーバーロードは、ディスクに適応するレプリカ管理の主要な障壁である:従来の反応的システムは、遷移中、何週間もにわたりクラスタIO帯域幅の100%を消費する。
  • PACEMAKER は、ピーク遷移IOをクラスタ帯域幅の5%未塔に低下させ、平均IOを0.2–0.4%に抑え、評価されたすべてのクラスタで遷移オーバーロードを解消した。
  • 4つの大規模クラスタ(110K–450Kディスク)において、平均で14–20%のストレージ節約を達成した。Google Cluster2では100K以上のディスクを節約(数百万のコスト削減に相当)。
  • Backblazeクラスタ(トレイクル配置)では、段階的で予防的な遷移により、6年以上にわたりIOが連続的かつ均等に分散され、大きなIOスパイクが発生しなかった。
  • 合計の遷移IOの90%以上が、予防的レイアウトとスケジューリングによって削減され、ステップ配置クラスタの98%の遷移が、効率的なバルクパリティ再計算で実行された。
  • PACEMAKER は、故障率のしきい値に達する前に遷移を開始することで、データの不保護状態をゼロに保ち、継続的なデータ保護を確保した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。