Skip to main content
QUICK REVIEW

[논문 리뷰] Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach

Yizhou Yang, Xin Liu|arXiv (Cornell University)|2022. 02. 22.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 체비셰프 분해 크리틱과 커버리지 기반 마스킹 메커니즘을 사용하여 행동 다양성을 갖춘 공격 전략을 생성하는 궁금증 기반의 다목적 강화학습 프레임워크를 제안한다. 이 방법은 크기와 동적으로 확장되는 공격 공간에서 탐색 효율성과 다목적 성능을 향상시키며, NASim 및 CAGE 환경에서 학습 안정성과 비지배적 공격 전략의 다양성 측면에서 최신 기술을 초월한다.

ABSTRACT

Penetration Testing plays a critical role in evaluating the security of a target network by emulating real active adversaries. Deep Reinforcement Learning (RL) is seen as a promising solution to automating the process of penetration tests by reducing human effort and improving reliability. Existing RL solutions focus on finding a specific attack path to impact the target hosts. However, in reality, a diverse range of attack variations are needed to provide comprehensive assessments of the target network's security level. Hence, the attack agents must consider multiple objectives when penetrating the network. Nevertheless, this challenge is not adequately addressed in the existing literature. To this end, we formulate the automatic penetration testing in the Multi-Objective Reinforcement Learning (MORL) framework and propose a Chebyshev decomposition critic to find diverse adversary strategies that balance different objectives in the penetration test. Additionally, the number of available actions increases with the agent consistently probing the target network, making the training process intractable in many practical situations. Thus, we introduce a coverage-based masking mechanism that reduces attention on previously selected actions to help the agent adapt to future exploration. Experimental evaluation on a range of scenarios demonstrates the superiority of our proposed approach when compared to adapted algorithms in terms of multi-objective learning and performance efficiency.

연구 동기 및 목표

  • 기존의 단일목적 강화학습에 의존하는 자동 침투 테스팅 에이전트에서 행동 다양성의 부족을 해결하기 위해.
  • 침투 테스팅에서 공격 영향, 권한 상승, 동작 비용 등의 목표를 균형 있게 조절하는 효과적인 다목적 학습을 가능하게 하기 위해.
  • 탐색 과정에서 새로운 동작이 추가되는 현실적인 침투 테스팅 시나리오에서 동적으로 확장되는 행동 공간을 처리하기 위해.
  • 커버리지 기반 마스킹 메커니즘을 통해 이전에 탐색한 동작에 대한 주의를 줄여 학습 효율성과 수렴성을 향상시키기 위해.
  • 수동적인 선호 설정이나 리워드 형상 조정 없이도 비지배적 공격 전략의 다양성을 생성하기 위해.

제안 방법

  • 불완전한 관측 가능성과 증가하는 행동 공간을 가진 다목적 마코프 결정 과정(MOMDP)으로 자동 침투 테스팅을 수식화한다.
  • 희소 리워드 학습을 위한 랜덤 네트워크 분산(RND)이 통합된 프록실러 근접 정책 최적화(PPO) 에이전트를 적용한다.
  • 이미 탐색된 동작에 대한 로짓을 억제하는 커버리지 기반 마스킹 메커니즘을 도입하여, 미탐색된 네트워크 세그먼트 쪽으로 탐색을 이끌어낸다.
  • 다양하고 비지배적인 공격 전략을 생성하기 위해 다중 목표를 균형 잡는 체비셰프 분해 크리틱을 제안한다.
  • 포괄성 성공과 권한 상승을 조합한 벡터 값 리워드를 사용하여 네트워크 탐색의 폭과 깊이 간의 트레이드오프를 모델링한다.
  • 커버리지 분포와 액터 네트워크 로짓을 융합하여 네트워크 탐색 진행 상황에 따라 동적으로 행동 선택을 형상화한다.

실험 결과

연구 질문

  • RQ1다목적 강화학습 에이전트는 현실적인 침투 테스팅 환경에서 다양하고 비지배적인 공격 전략을 생성할 수 있는가?
  • RQ2커버리지 기반 마스킹 메커니즘이 동적으로 확장되는 행동 공간을 가진 환경에서 학습 안정성과 효율성을 어떻게 향상시키는가?
  • RQ3체비셰프 크리틱은 전통적인 선형 스칼라화 기법에 비해 얼마나 더 다양한 고성능 공격 전략을 발견하는가?
  • RQ4큰 복잡한 네트워크 토폴로지에서 단일목적 및 가치 기반 기준 대비 제안된 방법의 성능과 안정성은 어떻게 스케일링되는가?
  • RQ5희소 리워드와 부분 관측 가능성이 있는 환경에서 에이전트는 효과적인 탐색과 수렴성을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 특히 중간 및 대규모 네트워크 시나리오에서 뛰어난 학습 안정성과 수렴성을 보이며, DQN과 개선된 DQN은 수렴에 실패하는 경우가 많다.
  • 커버리지 마스킹 메커니즘이 학습 효율성과 수렴성을 크게 향상시켜, 에이전트가 지속적으로 새로운 네트워크 세그먼트를 탐색하고 비최적 정책을 피할 수 있도록 한다.
  • 체비셰프 크리틱은 다양한 가중치 설정 범위에서 선형 스칼라화 기법으로 발견된 전략보다 비지배적인 전략 세트를 생성한다.
  • 이 방법은 다목적 학습에서 뛰어난 성능을 보이며, 타겟 호스트를 침투하는 것과 네트워크 내 페더홀드를 확보하는 것 사이의 트레이드오프를 효과적으로 균형 잡는다.
  • CAGE 벤치마크에서 제안된 방법은 타겟을 침투하기 위해 필요한 동작 수를 줄이고 동시에 액세스 획득 수를 늘려 효율성과 탐색 깊이가 향상됨을 보여준다.
  • 실제 침투 테스팅 시나리오에서 행동 공간이 증가하는 문제를 성공적으로 다루었으며, 사전 조건에 따라 동작 가능성이 결정되고 실행 중에 변화하는 환경에서도 유연하게 대응한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.