Skip to main content
QUICK REVIEW

[論文レビュー] Arbitrary Discrete Sequence Anomaly Detection with Zero Boundary LSTM

Chase Roberts, Manish Nair|arXiv (Cornell University)|Mar 6, 2018
Anomaly Detection Techniques and Applications参考文献 10被引用数 3
ひとこと要約

本稿では、安定的で数学的に根拠のある離散系列の異常検出を実現する、ゼロ境界LSTMオートエンコーダとOne-Class SVMを組み合わせた新規手法を提案する。系列の確率分布をモデル化し、文脈ベクトルを用いて外れ値の境界を定義することで、合成IPv4およびJSONデータセットにおいて、標準LSTMおよびスライディングウィンドウ手法よりも優れた安定性と性能を達成した。

ABSTRACT

We propose a simple mathematical definition and new neural architecture for finding anomalies within discrete sequence datasets. Our model comprises of a modified LSTM autoencoder and an array of One-Class SVMs. The LSTM takes in elements from a sequence and creates context vectors that are used to predict the probability distribution of the following element. These context vectors are then used to train an array of One-Class SVMs. These SVMs are used to determine an outlier boundary in context space.We show that our method is consistently more stable and also outperforms standard LSTM and sliding window anomaly detection systems on two generated datasets.

研究の動機と目的

  • 条件付き確率がゼロであるという形式的・理論的基準を、離散系列の異常として定義すること。
  • 予測確率の分散が大きいことによる、標準LSTMベースの異常検出の不安定性を是正すること。
  • 離散系列における異常検出のための安定した意思決定境界を生成するニューラルアーキテクチャを開発すること。
  • 構造的離散データにおいて、スライディングウィンドウ法および標準LSTM手法よりも、より強固で高性能な手法を実現すること。
  • サイバーセキュリティやシステム監視などの実世界の応用において、信頼性の高い異常検出を可能にすること。

提案手法

  • モデルは、入力系列から文脈ベクトルを生成するように変更されたLSTMオートエンコーダを用い、系列の依存関係を捉える。
  • 各文脈ベクトルは、系列の接頭辞を処理した後の隠れ状態を表し、文脈的情報をエンコードする。
  • これらの文脈ベクトルを用いて、潜在空間における意思決定境界を学習するOne-Class SVMのアレイを訓練する。
  • 系列の最終文脈ベクトルが学習済み境界の外側にある場合に異常を検出する。これは、次要素の予測確率がゼロであることを示唆する。
  • OCSVMの意思決定関数に可変なカットオフを用いることで、ゼロ中心の境界とは独立した柔軟なしきい値設定が可能になる。
  • この手法は理論的定義に基づいている:ある要素の前駆事象を条件としたときにその要素の条件付き確率がゼロである場合、系列は異常とみなされる。

実験結果

リサーチクエスチョン

  • RQ1深層学習を用いて、離散系列における異常を形式的かつ確率論的定義で導出し、実装することは可能か?
  • RQ2LSTMオートエンコーダの文脈ベクトルとOCSVMを組み合わせることで、標準LSTMベースの異常検出よりも安定した意思決定境界が得られるか?
  • RQ3本手法は、スライディングウィンドウ法およびn-gramベースラインと比較して、長距離依存関係や構造的異常の検出において、どのように性能を発揮するか?
  • RQ4訓練エポック数やハイパーパrameterの変化に伴い、モデルの性能と安定性がどの程度維持されるか?
  • RQ5標準モデルが見逃す可能性のある構造的違反(例:誤った構文、不正なグループ化)を検出できるか?

主な発見

  • IPv4データセットにおいて、ゼロ境界LSTMは、標準LSTMよりもすべての異常カテゴリで優れた性能を示した。特に、不正な数字グループ化やドットの誤った配置に関する誤検出の検出において顕著だった。
  • JSONデータセットでは、より単純なアーキテクチャと訓練設定を採用しているにもかかわらず、ゼロ境界LSTMは標準LSTMとほぼ同等の性能を達成した。
  • ゼロ境界LSTMは、エポックにわたる訓練において著しく高い安定性を示し、真陽性率および真陰性率が安定していた。これに対して、標準LSTMは大幅な変動を示した。
  • n-gramモデルは、有効な数値範囲を記憶できるため、桁数に関する異常の検出では両LSTMを上回ったが、誤ったネスティングや波括弧の欠落といった構造的問題では失敗した。
  • 限られた訓練データと短い系列でも、安定した意思決定境界を達成でき、誤検出と見逃し検出の両方を低減した。
  • システムは訓練データ内の異常にも感度を保ち続けたが、O(n³)の訓練複雑性のため、OCSVMのスケーラビリティが依然としてボトルネックである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。