[论文解读] Optimal Timing in Dynamic and Robust Attacker Engagement During Advanced Persistent Threats
本文在连续状态空间上构建了一个无折扣、无限时域的马尔可夫决策过程(MDP),以建模通过蜜罐网络对高级持续性威胁(APTs)进行防御者介入的最优时机。推导出一种基于阈值的最优策略,即在收集足够信息后决定何时驱逐攻击者,并通过斯塔克尔贝格博弈验证了该策略的鲁棒性,表明防御者通过平衡监控收益与暴露风险可实现最大效用。
Advanced persistent threats (APTs) are stealthy attacks which make use of social engineering and deception to give adversaries insider access to networked systems. Against APTs, active defense technologies aim to create and exploit information asymmetry for defenders. In this paper, we study a scenario in which a powerful defender uses honeynets for active defense in order to observe an attacker who has penetrated the network. Rather than immediately eject the attacker, the defender may elect to gather information. We introduce an undiscounted, infinite-horizon Markov decision process on a continuous state space in order to model the defender's problem. We find a threshold of information that the defender should gather about the attacker before ejecting him. Then we study the robustness of this policy using a Stackelberg game. Finally, we simulate the policy for a conceptual network. Our results provide a quantitative foundation for studying optimal timing for attacker engagement in network defense.
研究动机与目标
- 为解决在主动防御高级持续性威胁(APTs)过程中时机策略的关键空白,其中防御者必须在信息收集与暴露风险之间取得平衡。
- 将防御者决策建模为连续状态、无限时域的MDP,以捕捉监控收益与安全成本之间的动态权衡。
- 推导出一个解析最优策略,明确在收集到特定信息阈值后应执行驱逐操作。
- 通过零和斯塔克尔贝格博弈框架,测试该策略在对抗性信念操纵下的鲁棒性。
- 通过概念性网络模型的仿真验证该策略的性能与效用。
提出的方法
- 构建一个连续状态、无折扣的无限时域MDP,以建模防御者在蜜罐内应对攻击者移动时的行动。
- 利用递归方程推导值函数与最优策略,解为分段形式,基于效用阈值与信息累积而定。
- 引入一个阈值 $\omega$,用于确定防御者应在何时驱逐攻击者,该阈值由监控收益 $\delta_1^D$ 与风险 $p\lambda_N^D\bar{T}_A$ 的平衡关系推导得出。
- 应用斯塔克尔贝格博弈模型,其中攻击者先行选择信念参数,从而实现对最坏情况效用的分析,以评估鲁棒性。
- 通过数值验证与仿真,展示最优策略在不同攻击者持续时间与网络条件下的行为特征。
- 采用递归值函数分解:$\mathcal{V}(U^i, H)[k\delta, (k+1)\delta] = \delta_1^D + (1-p)\mathcal{V}(U^i - \delta, H)[(k-1)\delta, k\delta]$(当 $U^i \leq \omega + \delta$ 时),否则使用修改版本。
实验结果
研究问题
- RQ1在长时间对抗后,防御者应何时最优地将攻击者从蜜罐中驱逐?
- RQ2如何将防御者的决策建模为连续状态MDP,以平衡信息获取与暴露风险?
- RQ3在无折扣无限时域框架下,信息累积的何种阈值会触发最优驱逐决策?
- RQ4在斯塔克尔贝格博弈设定下,该最优策略对攻击者信念的对抗性操纵有多大的鲁棒性?
- RQ5当攻击者持续时间 $\bar{T}_A$ 趋近于零或无穷大时,防御者的效用的渐近行为如何?
主要发现
- 最优策略为基于阈值的:防御者应在攻击者效用水平达到临界阈值 $\omega$ 前持续收集信息,之后驱逐可使期望效用最大化。
- 阈值 $\omega$ 通过解析方式推导得出,其解满足方程 $\bar{T}_A\lambda_N^D = \chi_H^D(\omega - \delta k[\omega])(1-p)^{k[\omega]} + \frac{\delta_1^D}{p}(1 - (1-p)^{k[\omega]})$,该式平衡了监控收益与风险。
- 当 $\bar{T}_A \to 0$ 时,防御者的效用收敛于 $U^0\left(1 + \frac{1}{v}\left(C_H + C_N\frac{p}{1-p}\right)\right)$,表示在攻击者持续时间最小情况下的最大可持续效用。
- 当 $\bar{T}_A$ 较大时,防御者的效用受两个结果的加权和限制:长期监控带来的完整效用,或因过早驱逐导致的零效用,具体取决于 $\delta$ 与 $\omega$ 的取值。
- 斯塔克尔贝格博弈分析表明,即使在最坏情况的攻击者信念假设下,最优策略仍保持鲁棒,确保效用稳定。
- 仿真结果表明,所推导的策略优于简单策略,能够根据攻击者行为与系统参数动态调整驱逐时机。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。