Skip to main content
QUICK REVIEW

[논문 리뷰] CyGIL: A Cyber Gym for Training Autonomous Agents over Emulated Network Systems

Li Li, Raed Fayad|arXiv (Cornell University)|2021. 09. 07.
Reinforcement Learning in Robotics참고 문헌 10인용 수 21
한 줄 요약

CyGIL은 실제 네트워크 시스템에서 자율적인 사이버 에이전트를 훈련시키기 위한 에뮬레이션된 강화학습(RL) 환경이며, MITRE ATT&CK 프레임워크와 오픈소스 도구를 활용하여 고정밀도, 상태미존재형 훈련을 가능하게 한다. 이 환경은 공격자(레드팀) 및 방어자(블루팀) 에이전트의 훈련을 구성 가능한 공격 및 방어 시나리오로 지원하며, 변동하는 동작 성공률과 높은 지연 시간에도 불구하고 복잡한 공격 게임에서 DQN 에이전트의 누적 보상 성능이 90–92에 이를 수 있다.

ABSTRACT

Given the success of reinforcement learning (RL) in various domains, it is promising to explore the application of its methods to the development of intelligent and autonomous cyber agents. Enabling this development requires a representative RL training environment. To that end, this work presents CyGIL: an experimental testbed of an emulated RL training environment for network cyber operations. CyGIL uses a stateless environment architecture and incorporates the MITRE ATT&CK framework to establish a high fidelity training environment, while presenting a sufficiently abstracted interface to enable RL training. Its comprehensive action space and flexible game design allow the agent training to focus on particular advanced persistent threat (APT) profiles, and to incorporate a broad range of potential threats and vulnerabilities. By striking a balance between fidelity and simplicity, it aims to leverage state of the art RL algorithms for application to real-world cyber defence.

연구 동기 및 목표

  • 실제 네트워크 시스템에서 자율적인 사이버 에이전트를 위한 고정밀도, 확장 가능한 RL 훈련 환경의 부족을 해결하기 위해.
  • 에뮬레이션을 사용함으로써 시뮬레이션된 RL 환경과 실제 사이버 운영 간 격차를 줄이기 위해.
  • 실제 네트워크 행동과 변동하는 동작 성공률을 사용하여 대표성 있고 복잡한 공격 및 방어 시나리오에서 DRL 에이전트의 훈련을 가능하게 하기 위해.
  • OpenAI Gym 표준을 준수하는 모듈식이고 확장 가능한 아키텍처를 통해 레드팀 및 블루팀 에이전트 훈련을 모두 지원하기 위해.
  • 실제 사이버 운영 환경에서 경쟁적인 다중 에이전트 훈련을 통해 훈련 효율성과 모델 일반화 능력을 향상시키기 위해.

제안 방법

  • CyGIL은 오픈소스 네트워크 및 사이버 운영 도구를 기반으로 한 상태미존재형 환경 아키텍처를 사용하여 실제 네트워크 행동을 에뮬레이션하고 RL 훈련을 지원한다.
  • 레드팀 운영을 위한 엔터프라이즈 공격자 TTP를 포함하는 포괄적인 동작 공간을 정의하기 위해 MITRE ATT&CK 프레임워크를 통합한다.
  • 특정 APT 프로파일이나 광범위한 위협 커버리지에 초점을 맞춘 구성 가능한 게임 시나리오를 지원하여 타겟팅 또는 일반화된 에이전트 훈련을 가능하게 한다.
  • 실시간으로 에뮬레이션된 가상 머신에서 동작 실행이 이루어지며, 벽시계 시간이 실제 네트워크 지연 시간과 변동하는 성공 확률을 반영한다.
  • OpenAI Gym 인터페이스를 통해 모든 최신 SOTA RL/DRL 라이브러리와 호환되며, DQN 및 PPO와 같은 알고리즘의 즉시 사용(플러그 앤 플레이)을 가능하게 한다.
  • 행동 실행 및 환경 리셋 지연 시간을 줄이기 위해 VxRail 하이퍼컨버지드 인프라를 포함한 하드웨어 최적화 기법을 탐색 중이다.

실험 결과

연구 질문

  • RQ1어떻게 고정밀도와 확장성의 균형을 유지하면서 자율적인 사이버 에이전트를 위한 에뮬레이션된 RL 환경을 설계할 수 있는가?
  • RQ2변동하는 동작 성공률이 있는 실제 네트워크 환경에서 DRL 에이전트가 효과적이고 최적화된 공격 시퀀스를 얼마나 잘 학습할 수 있는가?
  • RQ3실제 네트워크 에뮬레이션의 지연 시간은 DRL 훈련 효율성과 정책 수렴에 어떤 영향을 미치는가?
  • RQ4통합된 환경이 경쟁적인 다중 에이전트 설정에서 레드팀 및 블루팀 에이전트 훈련을 모두 지원할 수 있는가?
  • RQ5어떤 아키텍처적 및 구현 선택 사항이 최신 SOTA RL 알고리즘과 실제 네트워크 에뮬레이션의 효율적 통합을 가능하게 하는가?

주요 결과

  • CyGIL은 DQN 알고리즘을 사용하여 실제 네트워크 환경에서 최적화된 공격 시퀀스를 학습시키는 데 성공했으며, 게임 2에서 누적 보상 90–92를 달성했다.
  • 복잡한 수평 이동 및 권한 상승을 포함하는 게임 2의 훈련 과정은 높은 동작 실행 지연과 네트워크 복잡성으로 인해 1 에피소드당 약 20–30분이 소요되었다.
  • 동작 실행 평균 시간은 게임 1의 1초 미만에서 게임 2의 최대 120초까지 다양했으며, 주로 VM 기반 네트워크 에뮬레이션과 베이컨트 전파 지연으로 인한 것이다.
  • 환경 리셋 시간은 게임 1에서 3초, 게임 2에서는 최대 40초였으며, 이는 에피소드 길이와 훈련 시간에 크게 기여했다.
  • 에이전트는 Active Directory 서버에서 수평 이동과 도메인 관리자 액세스를 달성하기 위해 최적의 동작 시퀀스(예: 동작 3, 4, 7, 13)를 선택하는 법을 학습했다.
  • 고정밀도 에뮬레이션 환경은 훈련 속도를 저하시키지만, 모델의 현실성과 실제 사이버 운영 적용 가능성은 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.