Skip to main content
QUICK REVIEW

[論文レビュー] Deep Actor-Critic Reinforcement Learning for Anomaly Detection

Chen Zhong, Mustafa Gürsoy|arXiv (Cornell University)|Aug 28, 2019
Smart Grid Security and Resilience参考文献 13被引用数 5
ひとこと要約

本稿では、異常プロセスの数が未知であるシステムにおけるアクティブな逐次異常検出のためのディープアクタークリティック強化学習フレームワークを提案する。後方確率に基づいてセンサーを動的に選択することで、主張遅延を最小限に抑えつつ信頼性を最大化し、高信頼度閾値下でもチェルノフ検定よりも遅延とスケーラビリティの面で優れている。

ABSTRACT

Anomaly detection is widely applied in a variety of domains, involving for instance, smart home systems, network traffic monitoring, IoT applications and sensor networks. In this paper, we study deep reinforcement learning based active sequential testing for anomaly detection. We assume that there is an unknown number of abnormal processes at a time and the agent can only check with one sensor in each sampling step. To maximize the confidence level of the decision and minimize the stopping time concurrently, we propose a deep actor-critic reinforcement learning framework that can dynamically select the sensor based on the posterior probabilities. We provide simulation results for both the training phase and testing phase, and compare the proposed framework with the Chernoff test in terms of claim delay and loss.

研究の動機と目的

  • 同時に異常である可能性のあるプロセスの数が未知である状況におけるアクティブな逐次異常検出の課題に対処すること。
  • 観測遅延を最小限に抑え、意思決定の信頼性を最大化するため、動的にセンサーを選択する強化学習エージェントを設計すること。
  • 区別可能な仮説を仮定するが、重複する観測分布の下で高い遅延を示す伝統的手法(例:チェルノフ検定)の限界を克服すること。
  • 初期事後確率が異なる状況、特に正常状態(H₀)から開始される場合に適応可能なしきい値の調整をテスト段階で可能にすること。

提案手法

  • M = 1 + Σₖ₌₁ᴺ (N choose k) 個の仮説を有する部分的に観測可能なマルコフ意思決定過程(POMDP)として異常検出問題を定式化する。
  • 正規状態(f)と異常状態(g)の未知の観測分布を、誤差確率ρを伴うベルヌーイ分布として最尤推定により近似する。
  • エージェントが事後確率に基づいて次のセンサーを選択するアクターと、行動価値関数を評価するクリティックを有するディープアクタークリティックネットワークを実装する。
  • 停止をトリガーする上側信頼度しきい値(π_up)と仮説の拒否をトリガーする下側信頼度しきい値(π_low)を定義し、π_up > π_low とする。
  • 遅延と誤った意思決定に対するペナルティを課す報酬関数を用いてエージェントを訓練し、高信頼度下での早期停止を促進する。
  • 事後確率が正しい仮説に収束することを保証するため、検証テストを用いて訓練を精緻化する。

実験結果

リサーチクエスチョン

  • RQ1未知の数の異常プロセスが同時に存在する異常検出において、強化学習エージェントはどのように動的にセンサーを選択し、主張遅延を最小限に抑えることができるか?
  • RQ2上側信頼度しきい値(π_up)と下側信頼度しきい値(π_low)を変化させた場合、テスト段階における主張遅延と意思決定損失にどのような影響が生じるか?
  • RQ3観測分布が完全に区別できない状況下で、提案されたアクタークリティックフレームワークはチェルノフ検定と比較して遅延と損失の面でどのように差をつけるか?
  • RQ4すべてのプロセスが正常状態(H₀)から開始される初期条件にエージェントはどのように適応できるか?また、これにより収束性とサンプリング時間にどのような影響が生じるか?
  • RQ5どのような条件下で、ディープRLエージェントが遅延と損失の両面でチェルノフ検定を上回るか?

主な発見

  • 提案されたアクタークリティックフレームワークは、特に上側信頼度しきい値π_up ≥ 0.75の場合、チェルノフ検定よりも顕著に低い主張遅延を達成している。
  • π_upが上昇するにつれて、エージェントの意思決定損失は減少し、高しきい値条件下での信頼性の向上と誤検出の低減を示している。
  • チェルノフ検定は、仮説が完全に区別可能であると仮定しているが、複数の仮説が同じ観測分布を示す場合(例:H₁、H₄、H₅、H₇はすべてセンサー1で異常行動を示す)にその仮定が崩れ、高い遅延を示す。
  • π_lowを低下させると、より厳密な拒否基準によりエージェントの損失はわずかに減少するが、その代わりにサンプリング時間が延長される。
  • エージェントはテスト段階においても頑健性を示し、H₀(正常状態の事後確率が高い)から開始される場合、より多くのサンプルを必要とするが、さまざまな初期条件下でも信頼性高く収束する。
  • 高信頼度状況(π_up ≥ 0.75)では、フレームワークがチェルノフ検定を遅延と損失の両面で上回り、サンプリングコストの高いシステムに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。