[논문 리뷰] Optimal Timing in Dynamic and Robust Attacker Engagement During Advanced Persistent Threats
이 논문은 연속 상태 공간에서 할인율이 없고 무한 시간 범위인 마르코프 결정 과정(MDP)을 설정하여, 허니넷을 통한 고도화된 지속적 위협(APT) 공격자에 대한 방어자 참여의 최적 타이밍을 모델링한다. 정보 수집 후 공격자를 퇴출할 시점에 대한 임계값 기반 최적 정책을 유도하고, 스택엘베르크 게임을 통해 강건성을 검증하여, 방어자가 감시 수익과 노출 위험 사이의 균형을 맞춤으로써 유틸리티를 최대화함을 보여준다.
Advanced persistent threats (APTs) are stealthy attacks which make use of social engineering and deception to give adversaries insider access to networked systems. Against APTs, active defense technologies aim to create and exploit information asymmetry for defenders. In this paper, we study a scenario in which a powerful defender uses honeynets for active defense in order to observe an attacker who has penetrated the network. Rather than immediately eject the attacker, the defender may elect to gather information. We introduce an undiscounted, infinite-horizon Markov decision process on a continuous state space in order to model the defender's problem. We find a threshold of information that the defender should gather about the attacker before ejecting him. Then we study the robustness of this policy using a Stackelberg game. Finally, we simulate the policy for a conceptual network. Our results provide a quantitative foundation for studying optimal timing for attacker engagement in network defense.
연구 동기 및 목표
- 공격자 정보 수집과 노출 위험 사이의 균형을 맞춰야 하는 활성 방어 전략에서의 타이밍 전략에 대한 핵심적 격차를 해결하기 위해.
- 감시 수익과 보안 비용 사이의 동적 상충 관계를 반영하기 위해, 연속 상태, 무한 시간 범위 MDP로 방어자 의사결정을 모델링하기 위해.
- 정보 수집의 임계값을 명시하는 분석적으로 최적의 정책을 도출하기 위해.
- 제로섬 스택엘베르크 게임 프레임워크를 사용하여 공격자 믿음 조작에 대한 이 정책의 강건성을 테스트하기 위해.
- 개념적 네트워크 모델에서 시뮬레이션을 통해 정책의 성능과 유틸리티를 검증하기 위해.
제안 방법
- 허니넷 내 공격자 이동에 대한 방어자 행동을 모델링하기 위해 연속 상태, 할인율 없음, 무한 시간 범위 MDP를 설정한다.
- 재귀 방정식을 사용하여 가치 함수와 최적 정책을 유도하며, 유틸리티 임계값과 정보 축적에 기반한 조각별 해를 제공한다.
- 감시 수익 $\delta_1^D$ 와 위험 $p\lambda_N^D\bar{T}_A$ 를 균형 잡는 데 사용되는 임계값 $\omega$ 를 도입한다. 이는 공격자를 퇴출할 시점을 결정한다.
- 공격자가 믿음 파라미터를 선택하는 주도적 역할을 하는 스택엘베르크 게임 모델을 적용하여, 악성 믿음 가정 하에서의 최악의 상황 유틸리티 분석을 가능하게 한다.
- 수치적 검증과 시뮬레이션을 통해 공격자 지속성과 네트워크 조건에 따라 최적 정책의 행동을 설명한다.
- 재귀 가치 함수 분해를 적용한다: $\mathcal{V}(U^i, H)[k\delta, (k+1)\delta] = \delta_1^D + (1-p)\mathcal{V}(U^i - \delta, H)[(k-1)\delta, k\delta]$ for $U^i \leq \omega + \delta$, 그 외의 경우 수정된 형태를 사용한다.
실험 결과
연구 질문
- RQ1장기간의 참여 후 허니넷에서 공격자를 퇴출할 최적의 타이밍은 무엇인가?
- RQ2감시 수익과 노출 위험 사이의 균형을 맞추기 위해, 방어자의 의사결정을 연속 상태 MDP로 어떻게 모델링할 수 있는가?
- RQ3할인율이 없고 무한 시간 범위 프레임워크 하에서, 정보 축적의 어떤 임계값이 최적의 퇴출 결정을 유도하는가?
- RQ4스택엘베르크 게임 환경에서 공격자 믿음 조작에 대해 최적 정책은 얼마나 강건한가?
- RQ5공격자 지속성 $\bar{T}_A$ 가 0 또는 무한대에 가까워질 때, 방어자의 유틸리티의 점근적 행동은 어떻게 되는가?
주요 결과
- 최적 정책은 임계값 기반이다: 방어자는 공격자의 유틸리티 수준이 임계값 $\omega$ 에 도달할 때까지 정보를 수집해야 하며, 이후 퇴출이 기대 유틸리티를 최대화한다.
- 임계값 $\omega$ 는 $\bar{T}_A\lambda_N^D = \chi_H^D(\omega - \delta k[\omega])(1-p)^{k[\omega]} + \frac{\delta_1^D}{p}(1 - (1-p)^{k[\omega]})$ 의 해로서 분석적으로 유도되며, 감시 수익과 위험을 균형 잡는 데 사용된다.
- $\bar{T}_A \to 0$ 일 때, 방어자의 유틸리티는 $U^0\left(1 + \frac{1}{v}\left(C_H + C_N\frac{p}{1-p}\right)\right)$ 로 수렴하며, 이는 최소한의 공격자 지속성 하에서 최대 지속 가능한 유틸리티를 나타낸다.
- 큰 $\bar{T}_A$ 에 대해, 방어자의 유틸리티는 두 결과의 가중합으로 제한된다: 장기 감시에서의 전면 유틸리티 또는 조기 퇴출로 인한 0 유틸리티로, 이는 $\delta$ 와 $\omega$ 에 따라 달라진다.
- 스택엘베르크 게임 분석은 최적 정책이 최악의 상황 공격자 믿음 가정 하에서도 강건함을 확인하여 유틸리티 안정성을 보장한다.
- 시뮬레이션은 유도된 정책이 공격자 행동과 시스템 파rameter에 따라 동적으로 퇴출 타이밍을 조정함으로써 단순한 전략보다 뛰어난 성능을 보임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.