Skip to main content
QUICK REVIEW

[論文レビュー] Anomaly Detection and Interpretation using Multimodal Autoencoder and Sparse Optimization

Yasuhiro Ikeda, Keisuke Ishibashi|arXiv (Cornell University)|Dec 18, 2018
Anomaly Detection Techniques and Applications参考文献 19被引用数 9
ひとこと要約

本稿では、マルチモーダルオートエンコーダー(MAE)とスパース最適化に基づく手法を提案し、クロスドメインICTシステムのデータにおける異常の検出と解釈を行う。MAEは、MIB、フロー、syslogなどの異種データタイプ間の非線形的関係を学習する。一方、スパース最適化により、局所化された異常を引き起こす最小限の入力次元の集合を特定し、従来のオートエンコーダーやPCAに比べて解釈可能性と検出精度を顕著に向上させる。実世界およびベンチマークデータセット上で検証された。

ABSTRACT

Automated anomaly detection is essential for managing information and communications technology (ICT) systems to maintain reliable services with minimum burden on operators. For detecting varying and continually emerging anomalies as differences from normal states, learning normal relationships inherent among cross-domain data monitored from ICT systems is essential. Deep-learning-based anomaly detection using an autoencoder (AE) is therefore promising for such complicated learning; however, its interpretation is still problematic. Since the dimensions of the input data contributing to the detected anomaly are not directly indicated in an AE, they are not suitable for localizing anomalies in large ICT systems composed of a huge amount of equipment. We propose an algorithm using sparse optimization for estimating contributing dimensions to anomalies detected with AEs. We also propose a multimodal AE (MAE) for effectively learning the relationships among cross-domain data, which can induce nonlinearity and differences in learnability among data types. We evaluated our algorithms with several datasets including real measured data in comparison with conventional algorithms and confirmed the superiority of our estimation algorithm in specifying contributing dimensions of anomalous data and our MAE in detecting anomalies in cross-domain data.

研究の動機と目的

  • 大規模ICTシステムにおける異常の局所化に失敗する従来のオートエンコーダーが、寄与する入力次元を特定できないという課題に対処すること。
  • MIB、フロー、syslogなどの異種データ(例:クロスドメイン)を扱う際、非線形的かつ異種的な関係をモデル化することで、異常検出を向上させること。
  • 検出された異常を解釈するための手法を開発し、異常を引き起こす最小限の入力特徴量の集合を推定すること。
  • 提案手法を実測データおよびベンチマークデータセット上で評価し、従来のAEおよびPCA手法に比べて優れた性能を示すこと。

提案手法

  • 異種データタイプ(MIB、フロー、syslog)から共同表現を学習するため、マルチモーダルオートエンコーダー(MAE)を設計。各モダリティを別々に事前学習し、共有ボトルネック層を微調整することで実現。
  • オートエンコーダーの再構成誤差にスパース最適化を適用し、異常を引き起こす寄与する最小限の入力次元の集合を特定。寄与ベクトルのスパarsityを促進する。
  • スケールの違いを補正するため、重み付き平均二乗誤差(wMSE)損失をMAEで使用。syslogのような低分散モダリティにおける異常の感度を向上。
  • 各入力次元の寄与度は、再構成誤差の勾配に基づく解析により算出され、L1正則化を用いてスパarsityを強制。
  • 実ネットワークデータおよびベンチマークデータセットを用い、標準的なAEおよびPCAと比較して、検出および局所化性能を評価。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルオートエンコーダーは、ICTシステムにおける異種クロスドメインデータ間の複雑な非線形的関係を効果的に学習できるか?
  • RQ2スパース最適化は、検出された異常を引き起こす最小限の入力次元の集合を正確に特定でき、効果的な局所化を可能にするか?
  • RQ3提案されたMAEは、特にsyslogのような低分散モダリティにおいて、標準的なオートエンコーダーやPCAを上回る異常検出性能を示すか?
  • RQ4提案手法は、ルールベースや従来の学習ベース手法と比較して、実世界のネットワーク障害事例においても優れた性能を示すか?

主な発見

  • 提案されたスパース最適化手法は、再構成誤差に基づく推定を上回り、大規模ICTシステムにおける異常の正確な局所化を可能にした。
  • 実ネットワークデータでは、MAEが20件の障害のうち10件を検出。標準的なAEおよびPCAは9件。そのうち8件はMAEにのみ検出された。これは、syslog異常に対する感度が向上したため。
  • 障害#7(SAPポート状態変更)は、標準的なAEおよびPCAでは検出されなかったが、MAEでは検出された。これは、事前学習とwMSE正規化により、低分散モダリティにおける異常検出が可能になったことを示している。
  • TCP SYN洪水(フローデータ経由)やpingチェック障害(MIBトラフィック量経由)といった異常を、運用者による確認済みの根本原因と一致する寄与度で正しく局所化した。
  • 検出および確認済みの障害におけるTPR(真正陽性率)は、MAEで0.5、標準的なAEおよびPCAで0.45であった。これは、検出の信頼性が向上したことを示している。
  • 手動で作成されたしきい値への依存を削減。あるユースケースでは、1,141個のルールベースしきい値を、1回の正規状態学習フェーズと1つのMSEしきい値に置き換えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。