Skip to main content
QUICK REVIEW

[論文レビュー] Implementing $\Diamond P$ with Bounded Messages on a Network of ADD Channels

Saptaparni Kumar, Jennifer L. Welch|arXiv (Cornell University)|Aug 9, 2017
Distributed systems and fault tolerance参考文献 5被引用数 3
ひとこと要約

本稿では、不確実な平均遅延/破損(ADD)チャネルを用いて、任意で分割可能なネットワークにおいても、限定的サイズのメッセージのみを用いて、最終的に完璧な障害検出器($ olinebreak[4]\Diamond P$)を実装するための新規アルゴリズムを提示する。本手法は、限定的ハートビート、動的タイムアウト調整、経路ベースの到達可能性チェックを組み合わせることで、チャネルの信頼性やネットワークトポロジーに関する最小限の仮定のもとで、最終的かつ強い正確性と強い完全性を達成する。

ABSTRACT

We present an implementation of the eventually perfect failure detector ($\Diamond P$) from the original hierarchy of the Chandra-Toueg oracles on an arbitrary partitionable network composed of unreliable channels that can lose and reorder messages. Prior implementations of $\Diamond P$ have assumed different partially synchronous models ranging from bounded point-to-point message delay and reliable communication to unbounded message size and known network topologies. We implement $\Diamond P$ under very weak assumptions on an arbitrary, partitionable network composed of Average Delayed/Dropped (ADD) channels to model unreliable communication. Unlike older implementations, our failure detection algorithm uses bounded-sized messages to eventually detect all nodes that are unreachable (crashed or disconnected) from it.

研究の動機と目的

  • 最小限のシステム仮定のもとで動作する障害検出アルゴリズムを設計すること、特に信頼性が低い部分的に同期的チャネルを有する分割可能なネットワークを想定すること。
  • メッセージ遅延や損失がほとんどのメッセージに対して無制限であっても、障害検出器が強い完全性と最終的かつ強い正確性を達成することを保証すること。
  • 任意のネットワークトポロジーをサポートしつつ、特定のメッセージサイズ $O((n+1)!)$ 以内に保ったまま、限定的サイズのメッセージを維持すること。
  • 従来は完全接続ネットワークに限定されていた ADD チャネルに関する先行研究を、一般の任意トポロジーに拡張すること。
  • 現実の分散システムにおける信頼性の低い通信を想定した、実用的でスケーラブルな障害検出ソリューションを提供すること。

提案手法

  • 各ノードは、ADD チャネル上で特権メッセージを用いて、隣接ノードに限定的サイズのハートビートメッセージを定期的に送信する。ADD チャネルは、遅延バウンド $d$ 内での配信を保証し、非特権メッセージのバーストを制限する。
  • ノードはローカルな疑惑状態を維持し、ハートビートの欠落に応じてタイムアウト値を動的に調整する。誤った疑惑が発生した場合にはタイムアウトを延長することで、誤検出を回避する。
  • 隣接ノードでないノードについては、ネットワークグラフ内のすべての単純経路をチェックすることで到達可能性を評価する。すべての途中ノードが正常に検出された状態である経路が存在しない場合、ノードは疑惑対象とされる。
  • アルゴリズムは経路列挙メカニズムを用いてノード間の潜在的ルートを追跡し、新しい疑惑状態が確認された場合にのみ経路情報を更新する。
  • ある経路に既に疑惑とマークされたノードが含まれる場合、そのノードの疑惑状態は真に設定され、一度設定されたら決して元に戻らない。
  • 限定的データ構造($n$ ビットの $\texttt{suspect\_local}[\cdot]$ と $O((n+1)!)$ の $\texttt{paths}[\cdot]$)の使用により、メッセージサイズが常に限定的であることが保証される。

実験結果

リサーチクエスチョン

  • RQ1分割可能なネットワークにおいて、ネットワークトポロジーおよびチャネル信頼性に関する仮定なしに、限定的メッセージサイズでのみ、最終的に完璧な障害検出器($ olinebreak[4]\Diamond P$)を実装できるか?
  • RQ2メッセージ損失や遅延が無制限であっても、強い完全性と最終的かつ強い正確性を達成するために必要なシステム仮定は何か?
  • RQ3限定的サイズのメッセージを効果的に用いて、動的で信頼性の低いネットワークにおける経路ベースの到達可能性情報を維持できるか?
  • RQ4従来は完全接続ネットワークに限定されていた ADD チャネルモデルを、限定的メッセージオーバーヘッドのもとで、任意で分割可能なトポロジーに拡張できるか?
  • RQ5同期性、チャネル動作、メッセージサイズに関する最小限の仮定のもとで、完璧な障害検出を達成することは可能か?

主な発見

  • アルゴリズムは強い完全性を達成する:すべての正しいノードは、自分から到達不能(停止または切断済み)とされたノードを最終的に疑惑対象とする。
  • アルゴリズムは最終的かつ強い正確性を達成する:すべての正しいノードは、自分から到達可能とされたノードを最終的に疑惑対象としなくなる。
  • 各ノードの疑惑状態は一度だけ設定され、その後は決して元に戻らないため、障害検出の意思決定が安定的かつ一貫性を持つ。
  • メッセージサイズは $O((n+1)!)$ ビット以内に限定され、経路数が最悪ケースの上限よりもはるかに小さいスパarsely 接続されたネットワークでは実用的である。
  • アルゴリズムは最小限の仮定のもとで正しく動作する:任意のネットワークトポロジー、非特権メッセージの無制限な損失および遅延、信頼性のあるチャネルの必要なし。
  • 正しさの証明は経路距離を基に帰納的推論を用い、ターゲットからの距離が増加するノードが、最終的にその到達可能性状態について完全な情報を得ることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。