Skip to main content
QUICK REVIEW

[論文レビュー] XFT: Practical Fault Tolerance Beyond Crashes

Shengyun Liu, Paolo Viotti|arXiv (Cornell University)|Feb 20, 2015
Distributed systems and fault tolerance参考文献 38被引用数 6
ひとこと要約

本論文は、多数のレプリカ間での同期通信を活用することで、追加のリソースコストなしに実用的なビザンチン障害耐性を実現する、新しい障害耐性モデルXFT(クロスフォールトトレランス)を導入する。XPaxosは、最初のXFTステートマシンレプリケーションプロトコルであり、CFTレベルのパフォーランスを達成しながら、ビザンチン障害とネットワーク非同期性に耐性を持つ。実世界のグローバルレプリケート環境における5Ninesの可用性を達成し、CFTおよびBFTプロトコルを上回る性能を発揮する。

ABSTRACT

Despite years of intensive research, Byzantine faulttolerant (BFT) systems have not yet been adopted in practice. This is due to additional cost of BFT in terms of resources, protocol complexity and performance, compared with crash fault-tolerance (CFT). This overhead of BFT comes from the assumption of a powerful adversary that can fully control not only the Byzantine faulty machines, but at the same time also the message delivery schedule across the entire network, effectively inducing communication asynchrony and partitioning otherwise correct machines at will. To many practitioners, however, such strong attacks appear irrelevant. In this paper, we introduce cross fault tolerance or XFT, a novel approach to building reliable and secure distributed systems and apply it to the classical state-machine replication (SMR) problem. In short, an XFT SMR protocol provides the reliability guarantees of widely used asynchronous CFT SMR protocols such as Paxos and Raft, but also tolerates Byzantine faults in combination with network asynchrony, as long as a majority of replicas are correct and communicate synchronously. This allows the development of XFT systems at the price of CFT (already paid for in practice), yet with strictly stronger resilience than CFT — sometimes even stronger than BFT itself. As a showcase for XFT, we present XPaxos, the first XFT SMR protocol. Although it offers much stronger resilience than CFT SMR at no extra resource cost, the performance of XPaxos matches that of the state-of-the art CFT protocols.

研究の動機と目的

  • 40年以上にわたる研究にもかかわらず、ビザンチン障害耐性システムの実用的導入におけるギャップを埋めること。
  • 完全に協調する敵アドバーシアリの仮定を緩和することで、BFTの見かけ上の負荷を低減すること。
  • リソースコストを増加させることなく、クラッシュ障害耐性(CFT)よりも強いレジリエンスを提供する障害耐性モデルを設計すること。
  • 現実的な障害モデル下で、CFTおよびBFTよりも高い信頼性を提供できるかどうかを実証すること。
  • グローバルで地理的に分散された環境におけるXPaxosのデプロイを通じて、XFTのパフォーマンスと可用性を検証すること。

提案手法

  • 多数のレプリカが正常であり、同期的に通信している限り、ビザンチン障害とネットワーク非同期性に耐性を持つXFTという障害耐性モデルを導入する。
  • CFTと同様に2t+1レプリカを用いるが、ビザンチン障害下でも安全かつライブネスを保証する、最初のXFTステートマシンレプリケーションプロトコルであるXPaxosを設計する。
  • ネットワークパーティションとビザンチン障害が同時に協調的でないという仮定を活用することで、従来のBFTが要求する3t+1レプリカの必要性を低減する。
  • Amazon EC2データセンターを跨ぐ生産環境に類似した環境で、実世界のパフォーランスを評価するために、XPaxosをApache ZooKeeperに統合する。
  • 独立同一分布障害モデル下で、XFTをCFTおよびBFTと比較するための確率的可用性解析を用いる。
  • WAN最適化された地理的に分散されたデプロイメントにおいて、スループットとレイテンシを測定するエンドツーエンドの評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1リソースコストを増加させることなく、CFTよりも強いレジリエンスを提供する障害耐性モデルを設計可能か?
  • RQ2敵モデルを緩和すること——具体的には、ネットワークパーティションとビザンチン障害が同時に協調的でないという仮定を置くこと——により、CFTレベルのパフォーランスで実用的なBFTを実現可能か?
  • RQ3現実的な障害分布下で、CFTおよびBFTよりも高い可用性を達成できるプロトコルは存在するか?
  • RQ4実世界のデプロイメントにおいて、Paxosのような最新のCFTプロトコルと同等のパフォーランスを達成するBFTプロトコルを構築可能か?
  • RQ5障害が独立同一分布確率変数としてモデル化された場合、XFTの可用性はCFTおよびBFTと比べてどの程度か?

主な発見

  • t=1の場合、マシンの可用性が0.999で、良性障害率が0.99999のとき、XPaxosはCFTより1つの9を追加した5Nines(99.999%)の可用性を達成する。
  • t=1の場合、XPaxosはBFTと同等の可用性の9数を達成するが、BFTが要求する3t+1レプリカではなく、2t+1レプリカで実現する。
  • t=2の場合、XPaxosはBFTよりも1つの9を追加し、3×9available−1の可用性を達成するのに対し、BFTは3×9available−2の可用性にとどまる。
  • EC2上の地理的に分散されたデプロイメントにおいて、XPaxosはWAN最適化されたPaxosの変種と同等のスループットとレイテンシを達成し、最高の利用可能なBFTプロトコルを著しく上回る。
  • Apache ZooKeeperのネイティブCFT SMRプロトコルを上回る性能を示しており、実世界のコordinationサービスにおける実用的妥当性を実証する。
  • 解析により、特にt≥2の場合、独立同一分布障害の仮定下で、XPaxosはBFTよりも厳密に強い信頼性保証を提供することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。