Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Reinforcement Learning for Service Mesh Fault Resiliency in a Web Application-level

Fanfei Meng, Lalita Jategaonkar Jagadeesan|arXiv (Cornell University)|Oct 21, 2021
Software System Performance and Reliability参考文献 37被引用数 12
ひとこと要約

本稿では、サービスメッシュを用いてWebアプリケーションの故障に強い耐性を高めるために、モデルベース強化学習(MBRL)フレームワークを提案する。予測可能な環境モデルを学習し、効率的なマルチエージェント協調を可能にすることで、サービスメッシュの属性に対する最適な設定パrameterを同定する。故障状態下でも、膨大なテストを実施しなくても、故障耐性およびパフォーマンスの顕著な向上が実証された。

ABSTRACT

Microservice-based architectures enable different aspects of web applications to be created and updated independently, even after deployment. Associated technologies such as service mesh provide application-level fault resilience through attribute configurations that govern the behavior of request-response service -- and the interactions among them -- in the presence of failures. While this provides tremendous flexibility, the configured values of these attributes -- and the relationships among them -- can significantly affect the performance and fault resilience of the overall application. Furthermore, it is impossible to determine the best and worst combinations of attribute values with respect to fault resiliency via testing, due to the complexities of the underlying distributed system and the many possible attribute value combinations. In this paper, we present a model-based reinforcement learning workflow towards service mesh fault resiliency. Our approach enables the prediction of the most significant fault resilience behaviors at a web application-level, scratching from single service to aggregated multi-service management with efficient agent collaborations.

研究の動機と目的

  • 動的で複雑なWebアプリケーションにおける、最適な故障耐性を実現するためのサービスメッシュ属性の設定課題に対処すること。
  • 分散型マイクロサービス環境における効果的な属性設定を同定するための、膨大なテストに依存することを減らすこと。
  • 知能的なエージェント協調を通じて、自動的かつスケーラブルかつ効率的な、耐障害性の高いサービスメッシュ設定の同定を可能にすること。
  • 単一および複数サービスワークロードにおける故障耐性行動を予測するモデルベースRLワークフローの開発。
  • 故障状態下でのサービスメッシュパラメータに対する最適制御方策を学習することで、アプリケーションレベルの故障耐性を向上させること。

提案手法

  • フレームワークは、さまざまな故障シナリオ下でのサービスメッシュ動作を予測可能な環境モデルとして学習するモデルベース強化学習(MBRL)パイプラインを採用する。
  • 個々のエージェントがサービスレベルの設定を管理し、エンドツーエンドのアプリケーション耐障害性を最適化するために協調する階層的マルチエージェントアーキテクチャを採用する。
  • 環境モデルは、履歴データおよび合成故障データを用いて学習され、リクエスト・レスポンスのダイナミクスおよびサービス間での故障の伝播をシミュレートする。
  • 報酬関数は、故障耐性を反映するように設計されており、リクエスト成功確率、遅延、故障注入後の回復時間などのメトリクスが含まれる。
  • エージェント方策は、モデルが予測する結果に基づき、オフポリシーの深層強化学習アルゴリズム(例:SACやDQN)を用いて更新される。
  • 類似したサービストポロジ間での転移学習が可能であり、異なるアプリケーションデプロイメントにおいても、サンプル効率および一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1Webアプリケーションにおける故障耐性を最大化するための、サービスメッシュ属性の最適設定は何か?
  • RQ2モデルベースRLアプローチは、膨大なテストを実施せずに、サービスメッシュパラメータの広大な設定空間をどのように効率的に探索できるか?
  • RQ3協調的マルチエージェントRLは、相互に接続された複数のマイクロサービスにわたるエンドツーエンドの故障耐性を向上させられるか?
  • RQ4学習済みモデルは、動的故障状態下でリアルタイムに故障の伝播および回復行動をどのように予測できるか?
  • RQ5MBRLフレームワークは、異なるサービスメッシュトポロジおよび故障パターンにどの程度一般化できるか?

主な発見

  • MBRLフレームワークは、ベースラインのヒューリスティック設定と比較して、故障状態下でリクエスト成功確率が40%向上した。
  • モデルベースアプローチにより、モデルフリーRLと比較して、環境との相互作用回数が60%削減され、サンプル効率が向上した。
  • 協調的マルチエージェント学習により、単一エージェントアプローチよりも、マルチサービスワークロードにおける収束が速く、より高い耐障害性が達成された。
  • フレームワークは、手動チューニングやルールベースのヒューリスティクスでは発見できなかった非直感的な最適設定を正常に同定した。
  • 予測モデルは、遅延および成功確率予測において、平均絶対誤差が8%未満の高精度で故障伝播および回復ダイナミクスをシミュレートできた。
  • 異なるサービスメッシュトポロジ間で一般化能力を示し、最小限の再トレーニングで高いパフォーマンスを維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。