Skip to main content
QUICK REVIEW

[論文レビュー] Simple Regenerating Codes: Network Coding for Cloud Storage

Dimitris Papailiopoulos, Jianqiang Luo|arXiv (Cornell University)|Sep 1, 2011
Cooperative Communication and Network Coding被引用数 4
ひとこと要約

この論文は、XOR演算のみを用いて高レートで低I/Oで障害ノードを修復可能な、分散ストレージコードの新規族であるSimple Regenerating Codes (SRC)を紹介する。MDSコードと局所的にデコード可能なパリティを組み合わせることで、$ f/(f+1) $ に近づける任意の高いデータレート(最大)を達成し、修復帯域幅は一定で、1回の修復に $ d = 2f $ 個のディスクアクセスで実現され、レプリケーションおよびReed-Solomonコードに比べて信頼性とストレージ効率で顕著に優れる。

ABSTRACT

Network codes designed specifically for distributed storage systems have the potential to provide dramatically higher storage efficiency for the same availability. One main challenge in the design of such codes is the exact repair problem: if a node storing encoded information fails, in order to maintain the same level of reliability we need to create encoded information at a new node. One of the main open problems in this emerging area has been the design of simple coding schemes that allow exact and low cost repair of failed nodes and have high data rates. In particular, all prior known explicit constructions have data rates bounded by 1/2. In this paper we introduce the first family of distributed storage codes that have simple look-up repair and can achieve arbitrarily high rates. Our constructions are very simple to implement and perform exact repair by simple XORing of packets. We experimentally evaluate the proposed codes in a realistic cloud storage simulator and show significant benefits in both performance and reliability compared to replication and standard Reed-Solomon codes.

研究の動機と目的

  • 分散ストレージシステムにおける実用的で高レートのエラー訂正コードを設計するという長年の課題に取り組む。
  • 従来の制限である明示的構成が最大1/2のデータレートに限定されていたという問題を克服する。
  • ノード修復時に低ディスクI/Oと最小限の計算負荷を実現しながらも、高い耐障害性を維持する。
  • 既存のMDSコードインfraに容易に統合可能な実用的で実装可能な符号化方式を提供する。
  • SRCの性能と信頼性を現実のクラウドストレージワークロードで評価し、レプリケーションおよびReed-Solomonコードと比較する。

提案手法

  • 提案されたSRCは二層構造を採用:データ信頼性のためのMDSコードと、効率的な局所的修復のための単純なXORベースのパリティ。
  • 各ノードはファイルサイズの $ \frac{f+1}{fk} $ を格納し、修復にはたった $ f $ 個のノードにアクセスし、それぞれから1つの符号化チャンクを読み込む。
  • 符号化パケットの単純なXOR組み合わせにより正確な修復が達成され、計算オーバーヘッドが最小限に抑えられる。
  • コードレートは $ R = \frac{f}{f+1} \cdot \frac{k}{n} $ であり、$ f $ を大きくすることで $ \frac{f}{f+1} $ に限りなく近づけることができる。
  • 修復帯域幅は $ \frac{f+1}{k} $ で、1回の修復に接触するノード数は $ d = 2f $ であり、$ n $ や $ k $ に依存しない。
  • 本手法は、任意の既存のMDSコードにXORベースのチャンク配置および局所的修復ルールを組み合わせることで実装される。

実験結果

リサーチクエスチョン

  • RQ1高データレートを達成しつつ、低I/Oで正確な修復が可能で、計算量が最小限の分散ストレージコードを設計可能か?
  • RQ2明示的かつ実用的な再生成コード構成で、1/2のデータレートの壁を破ることは可能か?
  • RQ3現実のクラウドワークロードにおいて、SRCの修復性能はレプリケーションおよびReed-Solomonコードと比べてどうか?
  • RQ4特に相関障害発生状況下でのデータ信頼性にSRCが与える影響は何か?
  • RQ5$ k $ が増加しても、SRCは高い性能と低ストレージオーバーヘッドを維持できるか?

主な発見

  • SRCは最大 $ \frac{f}{f+1} \cdot \frac{k}{n} $ のデータレートを達成でき、$ f $ を大きくすることで $ \frac{f}{f+1} $ に限りなく近づけることができ、従来の1/2のレート制限を打ち破った。
  • $(50,46,2)$ のSRCでは、3ウェイレプリケーションの約半分のストレージオーバーヘッドを実現しながら、4桁の信頼性の向上を達成した。
  • 3ウェイレプリケーションの劣化読み取り性能のおよそ60%を達成し、修復I/Oは著しく低く、再構築時間も短縮された。
  • 100台のマシンを模擬したHadoop型シミュレータにおいて、$ k $ が増加するに従い、SRCはレプリケーションおよびReed-Solomonコードを上回る修復帯域幅と信頼性を示した。
  • SRCの平均故障までの時間(MTTF)は、高レートでも3ウェイレプリケーションを何桁も上回った。
  • SRCは修復時間を30分(レプリケーションは15分)に短縮したが、高速な修復と障害の多様性のおかげで、はるかに優れた信頼性を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。