Skip to main content
QUICK REVIEW

[論文レビュー] On the Reliability of RAID Systems: An Argument for More Check Drives

Sarah Edge Mann, Michael T. Anderson|arXiv (Cornell University)|Feb 16, 2012
Advanced Data Storage Technologies参考文献 11被引用数 4
ひとこと要約

本論文は、大規模な「ビッグデータ」ストレージにおいて、RAIDシステムのチェックドライブ数を増やすことで信頼性が著しく向上することを主張している。リード・ソロモン符号と遅延微分方程式を用いた連続時間マルコフ連鎖を用いて、ドライブ障害、セクターエラー、修復プロセスをモデル化し、ミラーリングや標準RAID 6と比較して、より多くのチェックドライブを備えたシステムではデータ損失確率が著しく低下することを示している。

ABSTRACT

In this paper we address issues of reliability of RAID systems. We focus on "big data" systems with a large number of drives and advanced error correction schemes beyond \RAID{6}. Our RAID paradigm is based on Reed-Solomon codes, and thus we assume that the RAID consists of $N$ data drives and $M$ check drives. The RAID fails only if the combined number of failed drives and sector errors exceeds $M$, a property of Reed-Solomon codes. We review a number of models considered in the literature and build upon them to construct models usable for a large number of data and check drives. We attempt to account for a significant number of factors that affect RAID reliability, such as drive replacement or lack thereof, mistakes during service such as replacing the wrong drive, delayed repair, and the finite duration of RAID reconstruction. We evaluate the impact of sector failures that do not result in drive replacement. The reader who needs to consider large $M$ and $N$ will find applicable mathematical techniques concisely summarized here, and should be able to apply them to similar problems. Most methods are based on the theory of continuous time Markov chains, but we move beyond this framework when we consider the fixed time to rebuild broken hard drives, which we model using systems of delay and partial differential equations. One universal statement is applicable across various models: increasing the number of check drives in all cases increases the reliability of the system, and is vastly superior to other approaches of ensuring reliability such as mirroring.

研究の動機と目的

  • 実際の障害状況(ドライブ障害、セクターエラー、不完全な修復を含む)下での大規模RAIDシステムの信頼性を定量的に評価すること。
  • チェックドライブ数の増加がデータ損失確率および平均データ損失時間(MTTDL)に与える影響を評価すること。
  • 遅延修復や有限な再構築時間といった複雑な障害ダイナミクスを、遅延微分方程式および偏微分方程式を用いてモデル化すること。
  • ミラーリング、RAID 6、複数のチェックドライブを備えた大規模単一RAIDシステムを含む、さまざまなRAIDアーキテクチャの信頼性を比較すること。
  • ミラーリングや独立したRAIDグループといった代替信頼性戦略と比較して、より多くのチェックドライブがはるかに優れた性能を示すことを実証すること。

提案手法

  • 基本的な障害プロセスを連続時間マルコフ連鎖でモデル化し、固定時間再構築を伴うシステムへは遅延微分方程式を拡張してモデル化する。
  • 現実的な障害要因を組み込む:ドライブ交換を伴わないセクターエラー、遅延した修復、メンテナンス中の誤ったドライブ交換。
  • リード・ソロモン符号をエラー訂正メカニズムとして採用し、最大M個の誤った単語を検出可能で、M/2個のエラーを訂正可能とする。
  • 主な信頼性指標として、時間tまでのデータ損失確率(PDL_t)および平均データ損失時間(MTTDL)を分析する。
  • 符号理論および確率過程の数学的技術を用いて、大規模なN(データドライブ数)およびM(チェックドライブ数)のシステムをモデル化する。
  • 数値的評価を用いて、二重ミラーリング、独立したRAID 6、レイヤードRAID 6、M=4またはM=11を備えた単一の大規模RAIDを含む、複数のRAID設計を比較する。

実験結果

リサーチクエスチョン

  • RQ1高密度ドライブ数を有する大規模RAIDシステムにおいて、チェックドライブ数を増加させることは、データ損失確率にどのように影響するか?
  • RQ2ドライブ交換を引き起こさないセクターフェイルがRAIDの信頼性に与える影響は何か?
  • RQ3遅延修復および不完全なメンテナンスは、複数のチェックドライブを備えたRAIDシステムの信頼性にどのように影響するか?
  • RQ4M=11の単一の大規模RAIDシステムは、レイヤード構成やミラーリング構成と比較して、データ損失確率の面でどの程度優れているか?
  • RQ52つ以上のチェックドライブを備えたリード・ソロモン符号は、ビッグデータストレージシステムにおけるサイレントデータ破損を効果的に緩和できるか?

主な発見

  • チェックドライブ数の増加は、あらゆるモデルにおいて一貫してシステム信頼性を向上させ、M=11ではPDL_5が1.52×10⁻¹¹にまで低下し、他の構成と比べて著しく低い。
  • M=11を備えた単一の大規模RAIDシステムは、PDL_5が1.52×10⁻¹¹に達し、二重ミラーリングの10⁸倍、2つの独立したRAID 6システムの10¹⁰倍も低い。
  • M=11の大きなRAIDシステムはデータレート89%を維持しながらも、PDL_5が1.52×10⁻¹¹に留まり、レイヤードRAID 6および独立RAID 6の両方を信頼性面で上回っている。
  • 不完全な修復やセクターエラーが存在する状況下でも、M=11のシステムはPDL_5を8.55×10⁻¹³に維持しており、悪条件下でも高い耐性を示している。
  • モデルは、再構築時間hが長くなるほどMTTDLが低下することを示しており、再構築期間が長くなるとシステム信頼性が低下することを確認している。
  • システムに2つのチェックドライブを追加することで、サイレントデータ破損を検出・訂正する能力が、元のシステムのデータ整合性と同等の信頼性を達成できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。