Skip to main content
QUICK REVIEW

[論文レビュー] Smart Routing: Towards Proactive Fault-Handling in Software-Defined Networks

Ali Malik, Benjamin Aziz|arXiv (Cornell University)|Apr 1, 2019
Software-Defined Networks and 5G参考文献 44被引用数 5
ひとこと要約

本論文では、ソフトウェア定義ネットワーク(SDN)におけるプロアクティブな障害対処フレームワーク「スマートルーティング」を提案する。このフレームワークは、オンラインでの障害予測を活用して、実際の障害発生前に代替経路を事前に計算し、リスクの高いリンクを隔離する。SDNコントローラーのグローバルビューを活用することで、テストされたトポロジでサービス利用不能時間を最大25%まで短縮するが、誤検出によるルーティングのフラップ増加というトレードオフを伴う。

ABSTRACT

Software-defined networking offers numerous benefits against the legacy networking systems through simplifying the process of network management and reducing the cost of network configuration. Currently, the management of failures in the data plane is limited to two mechanisms: proactive and reactive. Such failure recovery techniques are activated after occurrences of failures. Therefore, packet loss is highly likely to occur as a result of service disruption and unavailability. This issue is not only related to the slow speed of recovery mechanisms, but also the delay caused by the failure detection process. In this paper, we define a new approach to the management of fault tolerance in software-defined networks where the goal is to eliminate the convergence process altogether, rather than speed up failure detection and recovery. We propose a new framework, called Smart Routing, which works based on the forewarning signs on failures in order to compute alternative paths and isolate the risky links from the routing tables of the data plane devices. We validate our framework through a set of experiments that demonstrate how the underlying model runs.

研究の動機と目的

  • 障害検出および回復の遅延に起因するサービス遮断が依然として発生する、SDNにおけるリアクティブおよびプロアクティブな回復メカニズムの限界を解消すること。
  • オンライン障害予測を用いた事前再構成を可能にすることで、障害回復におけるコンvergence遅延を排除すること。
  • SDNコントローラーのグローバルビューを活用してリスク認識に基づく経路計算を実施することで、ネットワークサービスの可用性を向上させること。
  • 実際の障害発生前に故障しつつあるリンクを早期に検出することで、パケット損失とサービス利用不能を最小限に抑えること。
  • 良好な可用性向上と誤検出によるルーティングフラップ増加のトレードオフを評価すること。

提案手法

  • フレームワークは、データプレーンにおけるリンク障害の兆候を早期に検出するオンライン障害予測メカニズムを用いる。
  • コントローラーは、予測されたリスクの高いリンクを経由するフローについて、ホップ数に基づく最適経路選択を用いて代替経路を計算する。
  • 障害発生前にルーティングテーブルからリスクの高いリンクを隔離するため、フロールールを更新する。
  • 予測が有効な再構成をトリガーするため、時間窓メカニズムを採用し、最小限の故障までの時間閾値(Next_F < 2分)を満たす必要がある。
  • 2段階のアルゴリズム(アルゴリズム1および2)を用いてリスクの高いリンクを同定し、それに応じてフロールールを更新する。動的閾値を用いることで、誤検出を低減する。
  • 予測の正確性を評価するために、正確度(precision)と再現率(recall)の指標を用いる。ルーティングフラップは誤検出(FP)の関数として測定される。

実験結果

リサーチクエスチョン

  • RQ1オンライン障害予測を活用して、リンク障害発生前に事前にSDN経路を再構成することが有効に機能するか?
  • RQ2障害予測に基づくプロアクティブルーティングは、デフォルトのSDN動作と比較して、サービス可用性およびルーティング安定性の面でどのように異なるか?
  • RQ3誤検出によるルーティングフラップ増加と照らし合わせた場合、サービス可用性の向上とそのトレードオフはどのようなものか?
  • RQ4コントローラーのグローバルビューが、SDNにおけるより効果的なリスクベースの経路再構成をどのように可能にするか?
  • RQ5障害予測は、SDNデータプレーンにおけるコンvergence遅延およびパケット損失をどの程度短減できるか?

主な発見

  • スマートルーティングは、すべてのテストされたトポロジでネットワークサービス可用性を向上させた。特にjanos-usでは再現率が高いため、最も高い改善効果を示した。
  • 再現率が低く(0.2〜0.3)ても、ダウンタイムの削減により、依然として顕著な可用性向上が達成された。
  • 最悪ケースのルーティングフラップ率は25%に達し、主に誤検出によるものであった。これは、可用性と安定性の間の明確なトレードオフを示している。
  • 無駄なフラップの数は、janos-usで最も高かった。これはリンク数が少なかったため、各リンクが複数の経路に含まれる可能性が高かったためである。
  • コントローラーが経路最適化にホップ数に依存しているため、同じホップ数の複数の経路はすべて最適とみなされ、帯域幅や混雑度などの他の指標の違いは無視される。
  • 予測された障害までの時間が短すぎる(Next_F < 2分)場合、コントローラーは再構成をスキップする。これにより、準備に十分な時間が確保される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。