Skip to main content
QUICK REVIEW

[论文解读] Deep Actor-Critic Reinforcement Learning for Anomaly Detection

Chen Zhong, Mustafa Gürsoy|arXiv (Cornell University)|Aug 28, 2019
Smart Grid Security and Resilience参考文献 13被引用 5
一句话总结

本文提出了一种用于未知异常进程数量的系统中主动序列异常检测的深度演员-评论家强化学习框架。通过基于后验概率动态选择传感器,智能体在最小化声明延迟的同时最大化置信度,在高置信度阈值下,其延迟和可扩展性优于切尔诺夫检验。

ABSTRACT

Anomaly detection is widely applied in a variety of domains, involving for instance, smart home systems, network traffic monitoring, IoT applications and sensor networks. In this paper, we study deep reinforcement learning based active sequential testing for anomaly detection. We assume that there is an unknown number of abnormal processes at a time and the agent can only check with one sensor in each sampling step. To maximize the confidence level of the decision and minimize the stopping time concurrently, we propose a deep actor-critic reinforcement learning framework that can dynamically select the sensor based on the posterior probabilities. We provide simulation results for both the training phase and testing phase, and compare the proposed framework with the Chernoff test in terms of claim delay and loss.

研究动机与目标

  • 解决当多个进程可能同时异常时,主动序列异常检测的挑战。
  • 设计一个强化学习智能体,通过动态选择传感器以最小化观测延迟并最大化决策置信度。
  • 克服传统方法(如切尔诺夫检验)的局限性,后者假设假设可区分,且在观测分布重叠时面临高延迟问题。
  • 在测试阶段实现自适应阈值设定,以应对初始后验概率不同的情况,特别是从正常状态(H₀)开始时。

提出的方法

  • 将异常检测问题建模为部分可观察马尔可夫决策过程(POMDP),其中假设数 M = 1 + Σₖ₌₁ᴺ (N choose k)。
  • 使用最大似然估计近似未知的观测分布(伯努利分布,误差概率为 ρ),分别对应正常状态(f)和异常状态(g)。
  • 实现一个深度演员-评论家网络,其中演员根据后验概率选择下一个传感器,评论家评估动作价值函数。
  • 定义上界(π_up)和下界(π_low)置信度阈值,分别用于触发停止和假设拒绝,且满足 π_up > π_low。
  • 使用一种奖励函数训练智能体,该函数对延迟和错误决策进行惩罚,从而在高置信度时鼓励提前停止。
  • 通过验证测试对训练过程进行优化,以确保后验概率收敛至正确假设。

实验结果

研究问题

  • RQ1强化学习智能体如何动态选择传感器,以在未知异常进程数量的异常检测中最小化声明延迟?
  • RQ2在测试阶段,上界和下界置信度阈值(π_up, π_low)的变化对声明延迟和决策损失有何影响?
  • RQ3当观测分布不能完全区分时,所提出的演员-评论家框架与切尔诺夫检验相比,在延迟和损失方面表现如何?
  • RQ4智能体能否适应所有进程初始均为正常状态(H₀)的情况?这对其收敛性和采样时间有何影响?
  • RQ5在何种条件下,深度强化学习智能体在延迟和损失两方面均优于切尔诺夫检验?

主要发现

  • 所提出的演员-评论家框架在声明延迟方面显著优于切尔诺夫检验,尤其当上界置信度阈值 π_up ≥ 0.75 时表现更优。
  • 随着 π_up 增大,智能体的决策损失降低,表明在高阈值条件下置信度提高,误报减少。
  • 切尔诺夫检验因假设假设完全可区分而表现出更高延迟,当多个假设共享相同观测分布时(例如,H₁、H₄、H₅、H₇ 在传感器1均显示异常行为),该假设失效。
  • 当 π_low 降低时,智能体的损失略有减少,这是由于更严格的拒绝标准减少了误报,但代价是采样时间增加。
  • 智能体在测试阶段表现出强鲁棒性,当从 H₀(正常状态后验概率较高)开始时需要更多样本,但在不同初始条件下仍能可靠收敛。
  • 在高置信度场景下(π_up ≥ 0.75),该框架在延迟和损失两方面均优于切尔诺夫检验,使其更适合采样成本较高的系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。