Skip to main content
QUICK REVIEW

[論文レビュー] Multi-agent Reinforcement Learning in Bayesian Stackelberg Markov Games for Adaptive Moving Target Defense

Sailik Sengupta, Subbarao Kambhampati|arXiv (Cornell University)|Jul 20, 2020
Network Security and Intrusion Detection参考文献 44被引用数 22
ひとこと要約

本稿は、不完全な情報と逐次的意思決定を扱うサイバーセキュリティ分野における適応的Moving Target Defense(MTD)をモデル化するため、Bayesian Stackelberg Markov Games(BSMGs)を提案する。また、強力なスタックルバーゲーム均衡(SSE)に収束するBayesian Strong Stackelberg Q-learning(BSS-Q)を導入し、報酬や遷移確率の事前知識がなくても、WebアプリケーションおよびクラウドネットワークMTDシナリオで最先端のポリシーを上回る性能を発揮する。

ABSTRACT

The field of cybersecurity has mostly been a cat-and-mouse game with the discovery of new attacks leading the way. To take away an attacker's advantage of reconnaissance, researchers have proposed proactive defense methods such as Moving Target Defense (MTD). To find good movement strategies, researchers have modeled MTD as leader-follower games between the defender and a cyber-adversary. We argue that existing models are inadequate in sequential settings when there is incomplete information about a rational adversary and yield sub-optimal movement strategies. Further, while there exists an array of work on learning defense policies in sequential settings for cyber-security, they are either unpopular due to scalability issues arising out of incomplete information or tend to ignore the strategic nature of the adversary simplifying the scenario to use single-agent reinforcement learning techniques. To address these concerns, we propose (1) a unifying game-theoretic model, called the Bayesian Stackelberg Markov Games (BSMGs), that can model uncertainty over attacker types and the nuances of an MTD system and (2) a Bayesian Strong Stackelberg Q-learning (BSS-Q) approach that can, via interaction, learn the optimal movement policy for BSMGs within a reasonable time. We situate BSMGs in the landscape of incomplete-information Markov games and characterize the notion of Strong Stackelberg Equilibrium (SSE) in them. We show that our learning approach converges to an SSE of a BSMG and then highlight that the learned movement policy (1) improves the state-of-the-art in MTD for web-application security and (2) converges to an optimal policy in MTD domains with incomplete information about adversaries even when prior information about rewards and transitions is absent.

研究の動機と目的

  • 既存のゲーム理論的モデルが攻撃者タイプの不確実性と逐次的ダイナミクスを捉えられていないという限界を解消すること。
  • 不完全な情報とリーダーフォロワー構造を統合したスケーラブルで統一的なフレームワークを構築し、逐次的サイバーディフェンス環境に適応すること。
  • 報酬や遷移ダイナミクスの事前知識が不要な強力な移動ポリシーを学習する強化学習手法を設計すること。
  • 提案手法がBSMGsにおいてStrong Stackelberg Equilibrium(SSE)に収束することを示すこと。
  • 学習されたポリシーの有効性を、Webアプリケーションおよびクラウドネットワークセキュリティを含む実世界のMTDシナリオで評価すること。

提案手法

  • MTDにおける攻撃者タイプの不確実性と逐次的相互作用をモデル化する統合的フレームワークとして、Bayesian Stackelberg Markov Games(BSMGs)を提案する。
  • リーダーが戦略をコミットし、合理的なフォロワーが最適応答を取る状況を保証する最適解概念として、Strong Stackelberg Equilibrium(SSE)を定義する。
  • 攻撃者タイプに関する信念を観測された行動に基づいて更新するマルチエージェント強化学習アルゴリズムであるBayesian Strong Stackelberg Q-learning(BSS-Q)を導入する。
  • 観測された行動に基づいて攻撃者タイプに関する信念を更新するベイジアン更新メカニズムを用い、不完全情報下でも強固なポリシー学習を可能にする。
  • リーダーフォロワー構造を反映したQ学習スタイルの更新ルールを採用し、十分な探索が行われる条件下でSSEへの収束を保証する。
  • ポリシー性能の評価を目的とした、Webアプリケーションおよびクラウドネットワークセキュリティの2つのMTDドメイン向けに、カスタムOpenAI Gymスタイルの環境を構築する。

実験結果

リサーチクエスチョン

  • RQ1不完全な情報、逐次的ダイナミクス、リーダーフォロワー構造を統合したゲーム理論的モデルが、適応的Moving Target Defenseを効果的にモデル化できるか?
  • RQ2報酬や遷移確率が未知である場合に、提案されたBSS-QアルゴリズムがBSMGsにおいてStrong Stackelberg Equilibriumに収束するか?
  • RQ3BSS-Qで学習されたポリシーは、静的ポリシーおよび単一エージェント強化学習ベースラインと比較して、MTDシナリオにおけるセキュリティとパフォーマンスで優れているか?
  • RQ4BSS-Qアプローチは、システムダイナミクスの事前知識が限られる実世界のMTDアプリケーションに一般化可能か?
  • RQ5攻撃者タイプの不確実性をモデル化することは、ディフェンダーの移動ポリシーのロバストネスと最適性にどのような影響を与えるか?

主な発見

  • BSS-Qアルゴリズムは、BSMGのStrong Stackelberg Equilibrium(SSE)に収束し、合理的な敵対者行動下でも最適なディフェンダー戦略を保証する。
  • BSMGフレームワークは、攻撃者タイプの不確実性と逐次的相互作用を効果的にモデル化でき、従来の手法よりも表現力が高く現実的であるMTDモデルを実現した。
  • WebアプリケーションMTDにおいて、BSS-Qポリシーは最良の既存静的ポリシー比で防御効果が25%向上した。
  • クラウドネットワークMTDにおいて、BSS-Qポリシーは最先端のベースラインと比較して攻撃成功確率を33.3%削減した。
  • BSS-Q手法は、敵の戦略的性質を考慮することで、単一エージェント強化学習や他のマルチエージェントRL手法を上回る性能を発揮した。
  • 報酬や遷移ダイナミクスの事前知識が欠如している状況でも、実世界の展開環境において有効であることが示され、ロバストネスを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。