Skip to main content
QUICK REVIEW

[論文レビュー] Exact Minimum-Repair-Bandwidth Cooperative Regenerating Codes for Distributed Storage Systems

Kenneth W. Shum, Yuchong Hu|arXiv (Cornell University)|Feb 8, 2011
Advanced Data Storage Technologies参考文献 11被引用数 12
ひとこと要約

本稿では、複数同時障害に対し最適な修復帯域幅を達成する、分散ストレージシステム向けの正確な最小修復帯域幅協調再生(MBCR)コードの族を提案する。体系的符号化と有限体上の構造的行列ベースの構成を用いることで、修復帯域幅に関する導出された理論的下界に一致し、最小限のネットワークトラフィックで複数の障害発生ノードを同時に効率的に修復可能となる。

ABSTRACT

In order to provide high data reliability, distributed storage systems disperse data with redundancy to multiple storage nodes. Regenerating codes is a new class of erasure codes to introduce redundancy for the purpose of improving the data repair performance in distributed storage. Most of the studies on regenerating codes focus on the single-failure recovery, but it is not uncommon to see two or more node failures at the same time in large storage networks. To exploit the opportunity of repairing multiple failed nodes simultaneously, a cooperative repair mechanism, in the sense that the nodes to be repaired can exchange data among themselves, is investigated. A lower bound on the repair-bandwidth for cooperative repair is derived and a construction of a family of exact cooperative regenerating codes matching this lower bound is presented.

研究の動機と目的

  • 複数のノード障害が一般的な大規模分散ストレージシステムにおける単一障害修復の非効率性を解消する。
  • 1つずつ修復する制限を克服し、複数の障害ノードを同時に協調的に修復可能にする。
  • 分散ストレージシステムにおける協調的修復の修復帯域幅に関する理論的下界を導出する。
  • この下界に達する明示的な正確な MBCR コードを構築し、最適な修復性能を保証する。
  • コードが体系的であることにより、完全な再構築なしにデータパケットへの直接アクセスを可能にする。

提案手法

  • r 個の障害発生ノードの協調的修復における修復帯域幅に関する理論的下界を導出し、1ノードあたり最低でも (2d + r - 1) パケットの帯域幅が必要であることを示す。
  • 拡張 Reed-Solomon コードの生成行列に基づく体系的符号化方式を用いて、正確な MBCR コードの族を構築する。
  • 3段階の修復プロセスを設計する:(1) 新規ノードがd個の生存ノードからそれぞれkパケットをダウンロードする、(2) 新規ノードが中間計算結果を交換する、(3) 新規ノードが失われたデータを再構築し、パリティ情報を交換する。
  • 符号化に巡回シフトパターンを用いることで、体系的およびパリティパケットをノード間で均等に分散させ、kノードの回復可能性を確保する。
  • 有限体のサイズがnに線形に増加することを保証し、大規模システムにおいて実用的であることを裏付ける。
  • 合計修復帯域幅が導出された下界と一致することを示し、最適性を検証する:r 個の障害発生に対して r(2d + r - 1) パケット。

実験結果

リサーチクエスチョン

  • RQ1分散ストレージシステムにおいて、r 個の障害発生ノードを協調的に修復するために必要な理論的最小修復帯域幅は何か?
  • RQ2体系的符号化などのシステムレベルの特性を維持しつつ、この最小修復帯域幅に達する正確な協調的再生コードを構築可能か?
  • RQ3複数の障害発生ノードの共同修復中に、合計ネットワークトラフィックを最小限に抑えるために修復プロセスをどのように構造化できるか?
  • RQ4生存ノード数d、障害数r、修復帯域幅の間にはどのような関係があるか?
  • RQ5ノード数の増加に伴い、必要な有限体サイズを制御することで、この構成を実用的に行えるか?

主な発見

  • 協調的修復におけるr個の障害発生ノードの修復帯域幅に関する理論的下限が (2d + r - 1) パケット/ノードとして導出された。
  • 提案された構成により、この下限に到達しており、コードが修復帯域幅の観点で最適であることが証明された。
  • n=5、d=k=3、r=2 の例では、合計修復帯域幅が14パケットであり、障害発生ノード1つあたり7パケットとなり、理論的下限と一致する。
  • コードは体系的であるため、データパケットを格納しているノードに直接アクセスするだけで、任意のデータパケットに直接アクセス可能である。
  • 必要な有限体サイズがノード数nに線形に増加するため、スケーラブルかつ実用的である。
  • 修復プロセスは完全に正確であり、新規ノードに再生されたデータが、障害発生ノードの元のデータとビット単位で完全に同一である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。