[论文解读] CyGIL: A Cyber Gym for Training Autonomous Agents over Emulated Network Systems
CyGIL 是一个用于在真实网络系统中训练自主网络代理的模拟强化学习(RL)环境,利用 MITRE ATT&CK 框架和开源工具,实现高保真度、无状态的训练。它支持红队与蓝队代理的训练,可配置攻击与防御场景,在复杂攻击游戏中,尽管动作成功率波动且延迟较高,仍实现了 DQN 代理 90–92 的累积奖励。
Given the success of reinforcement learning (RL) in various domains, it is promising to explore the application of its methods to the development of intelligent and autonomous cyber agents. Enabling this development requires a representative RL training environment. To that end, this work presents CyGIL: an experimental testbed of an emulated RL training environment for network cyber operations. CyGIL uses a stateless environment architecture and incorporates the MITRE ATT&CK framework to establish a high fidelity training environment, while presenting a sufficiently abstracted interface to enable RL training. Its comprehensive action space and flexible game design allow the agent training to focus on particular advanced persistent threat (APT) profiles, and to incorporate a broad range of potential threats and vulnerabilities. By striking a balance between fidelity and simplicity, it aims to leverage state of the art RL algorithms for application to real-world cyber defence.
研究动机与目标
- 解决在真实网络系统中缺乏高保真度、可扩展的 RL 训练环境的问题,以训练自主网络代理。
- 通过使用网络仿真而非模拟,缩小模拟 RL 环境与真实网络操作之间的差距。
- 利用真实网络行为和波动的动作成功率,在代表性、复杂的攻防场景中训练深度强化学习(DRL)代理。
- 通过符合 OpenAI Gym 标准的模块化、可扩展架构,同时支持红队与蓝队代理的训练。
- 通过在真实网络操作环境中实现多代理、对抗性训练,提高训练效率和模型泛化能力。
提出的方法
- CyGIL 使用基于开源网络与网络操作工具的无状态环境架构,模拟真实网络行为并支持 RL 训练。
- 它整合 MITRE ATT&CK 框架,定义涵盖企业级对手战术、技术与过程(TTPs)的完整动作空间,用于红队操作。
- 该环境支持可配置的游戏场景,可聚焦于特定 APT 威胁模型或广泛威胁覆盖,实现针对性或通用型代理训练。
- 动作执行在模拟的虚拟机上实时进行,墙钟时间反映真实网络延迟和波动的成功概率。
- 系统通过 OpenAI Gym 接口与所有 SOTA RL/DRL 库兼容,支持 DQN 和 PPO 等算法的即插即用。
- 正在探索硬件优化措施,包括 VxRail 超融合基础设施,以降低动作执行和环境重置延迟。
实验结果
研究问题
- RQ1如何设计一个模拟 RL 环境,以在训练自主网络代理时平衡高保真度与可扩展性?
- RQ2DRL 代理在具有波动动作成功率的真实网络环境中,能在多大程度上学习到有效且优化的攻击序列?
- RQ3真实网络仿真的延迟如何影响 DRL 训练效率和策略收敛?
- RQ4一个统一的环境能否在对抗性多代理设置中同时支持红队与蓝队代理的训练?
- RQ5哪些架构与实现选择能够实现 SOTA RL 算法与真实网络仿真的高效集成?
主要发现
- CyGIL 有效支持 DRL 代理在真实网络环境中学习优化的攻击序列,在 Game 2 中使用 DQN 算法实现了 90–92 的累积奖励。
- Game 2 的训练过程涉及复杂的横向移动与权限提升,每集耗时 20–30 分钟,主要由于高动作执行延迟和网络复杂性。
- 动作执行的平均时间在 Game 1 中低于 1 秒,在 Game 2 中高达 120 秒,主要归因于基于虚拟机的网络仿真和信标传播延迟。
- 环境重置时间在 Game 1 中为 3 秒,在 Game 2 中高达 40 秒,显著增加了每集时长和整体训练时间。
- 代理学会了选择最优动作序列,如动作 3、4、7 和 13,以实现对 Active Directory 服务器的横向移动和域管理员访问。
- 高保真度仿真环境虽然减缓了训练速度,但提升了模型的真实感与在真实世界网络操作中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。