[論文レビュー] CyGIL: A Cyber Gym for Training Autonomous Agents over Emulated Network Systems
CyGIL は、MITRE ATT&CK フレームワークとオープンソースツールを活用して、高精度で状態なしの訓練を可能にする、実際のネットワーキングシステムにおける自律的サイバー攻撃エージェントのためのエミュレーテッド強化学習(RL)環境である。この環境は、攻撃および防御のシナリオをカスタマイズ可能に設定でき、変動するアクション成功確率と高い遅延があるにもかかわらず、DQNエージェントの累積報酬が90〜92に達する。
Given the success of reinforcement learning (RL) in various domains, it is promising to explore the application of its methods to the development of intelligent and autonomous cyber agents. Enabling this development requires a representative RL training environment. To that end, this work presents CyGIL: an experimental testbed of an emulated RL training environment for network cyber operations. CyGIL uses a stateless environment architecture and incorporates the MITRE ATT&CK framework to establish a high fidelity training environment, while presenting a sufficiently abstracted interface to enable RL training. Its comprehensive action space and flexible game design allow the agent training to focus on particular advanced persistent threat (APT) profiles, and to incorporate a broad range of potential threats and vulnerabilities. By striking a balance between fidelity and simplicity, it aims to leverage state of the art RL algorithms for application to real-world cyber defence.
研究の動機と目的
- 自律的サイバー攻撃エージェントのための高精度でスケーラブルな RL 訓練環境が、実際のネットワーキングシステムに不足している問題を解決すること。
- シミュレーションではなくネットワークエミュレーションを用いることで、シミュレーテッド RL 環境と実世界のサイバー作戦の間のギャップを縮小すること。
- 実際のネットワーク行動と変動するアクション成功確率を用いて、代表的で複雑な攻撃および防御シナリオにおける DRL エージェントの訓練を可能にすること。
- OpenAI Gym 標準に準拠したモジュラで拡張可能なアーキテクチャを通じて、赤チームおよび藍チームの両方のエージェント訓練を支援すること。
- 実際のサイバー作戦環境におけるマルチエージェントで競争的な訓練を可能にすることで、訓練効率とモデルの汎化能力を向上させること。
提案手法
- CyGIL は、オープンソースのネットワークおよびサイバー作戦ツールに基づいた状態なしの環境アーキテクチャを採用し、実際のネットワーク行動をエミュレートするとともに、RL 訓練を支援する。
- 赤チーム作業のためのエンタープライズ敵対行動TTPをカバーする包括的なアクションスペースを定義するために、MITRE ATT&CK フレームワークを統合している。
- 特定のAPTプロファイルや広範な脅威カバレッジに焦点を当てたカスタマイズ可能なゲームシナリオをサポートしており、標的型または汎用的なエージェント訓練が可能である。
- アクション実行はエミュレーテッド仮想マシン上でリアルタイムで行われ、壁時計時間による遅延と変動する成功確率が反映される。
- OpenAI Gym インターフェースを介して、DQN や PPO などのアルゴリズムを即座に統合可能なように、すべての最先端の RL/DRL ライブラリと互換性を持つように設計されている。
- アクション実行および環境リセットの遅延を低減するために、VxRailハイパーコンバージドインフラストラクチャを含むハードウェア最適化の検討が進められている。
実験結果
リサーチクエスチョン
- RQ1高精度とスケーラビリティの両立を図るエミュレーテッド RL 環境を、自律的サイバー攻撃エージェントの訓練にどう設計できるか?
- RQ2変動するアクション成功確率を伴う現実的なネットワーク環境において、DRL エージェントが効果的で最適化された攻撃シーケンスをどれほど学習できるか?
- RQ3実際のネットワークエミュレーションの遅延が、DRL 訓練効率および方策収束にどのように影響するか?
- RQ4統合された環境が、競争的でマルチエージェントの設定において、赤チームおよび藍チーム両方のエージェント訓練を可能にするか?
- RQ5最先端の RL アルゴリズムと実際のネットワークエミュレーションを効率的に統合するためのアーキテクチャ的および実装的選択肢は何か?
主な発見
- CyGIL は、DQN アルゴリズムを用いて、現実的なネットワーク環境で最適化された攻撃シーケンスを DRL エージェントが学習できることを実証した。Game 2 では累積報酬が90〜92に達した。
- Game 2 では、複雑な横向き移動と特権昇格を含むため、1エピソードあたり20〜30分の訓練時間がかかった。
- 平均アクション実行時間は Game 1 で1秒未塔、Game 2 では最大120秒に達しており、主に仮想マシンベースのネットワークエミュレーションとビーコン伝播遅延によるものである。
- 環境リセット時間は Game 1 で3秒、Game 2 では最大40秒に達し、エピソードの長さと訓練時間に顕著な影響を与えた。
- エージェントは、Active Directory サーバーでの横向き移動とドメイン管理者アクセスを達成するため、アクション3、4、7、13の最適なシーケンスを選択するよう学習した。
- 高精度のエミュレーション環境は訓練を遅くするが、モデルの現実世界への適用性と現実性を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。