[論文レビュー] Autoencoder-based Unsupervised Intrusion Detection using Multi-Scale Convolutional Recurrent Networks
本稿では、ネットワークトラフィックの空間的特徴抽出にマルチスケール畳み込みニューラルネットワークを、時間的パターン学習にLSTMベースのオートエンコーダーを組み合わせた、教師なしインラインスティクション検出モデルMSCNN-LSTM-AEを提案する。このモデルは、空間的・時間的モデリングと隔離木ベースの誤検出補正を組み合わせることで、CICDDoS2019データセットにおいて最先端の性能を達成し、高い再現率(98.81%)とF1スコア(98.46%)を実現した。
The massive growth of network traffic data leads to a large volume of datasets. Labeling these datasets for identifying intrusion attacks is very laborious and error-prone. Furthermore, network traffic data have complex time-varying non-linear relationships. The existing state-of-the-art intrusion detection solutions use a combination of various supervised approaches along with fused features subsets based on correlations in traffic data. These solutions often require high computational cost, manual support in fine-tuning intrusion detection models, and labeling of data that limit real-time processing of network traffic. Unsupervised solutions do reduce computational complexities and manual support for labeling data but current unsupervised solutions do not consider spatio-temporal correlations in traffic data. To address this, we propose a unified Autoencoder based on combining multi-scale convolutional neural network and long short-term memory (MSCNN-LSTM-AE) for anomaly detection in network traffic. The model first employs Multiscale Convolutional Neural Network Autoencoder (MSCNN-AE) to analyze the spatial features of the dataset, and then latent space features learned from MSCNN-AE employs Long Short-Term Memory (LSTM) based Autoencoder Network to process the temporal features. Our model further employs two Isolation Forest algorithms as error correction mechanisms to detect false positives and false negatives to improve detection accuracy. %Additionally, covariance matrices forms a Riemannian manifold that is naturally embedded with distance metrices that facilitates descriminative patterns for detecting malicious network traffic. We evaluated our model NSL-KDD, UNSW-NB15, and CICDDoS2019 dataset and showed our proposed method significantly outperforms the conventional unsupervised methods and other existing studies on the dataset.
研究の動機と目的
- 高次元で時間的に変化する非線形なネットワークトラフィックデータのインラインスティクション検出において、高価な手動ラベリングに依存しない課題に対処すること。
- 従来の教師なしモデルがネットワークトラフィックにおける空間的および時間的相関を捉えられていないという限界を克服すること。
- 教師なしの方法で空間的および時間的特徴を統合的に学習できる統一されたオートエンコーダーフレームワークを構築すること。
- 2段階の隔離木アルゴリズムを用いて、オートエンコーダーのしきい値ベースの再構成誤差から生じる誤検出(偽陽性・偽陰性)を低減すること。
- 特に再現率とF1スコアにおいて、最先端の教師あり・教師なし手法と比較して優れた性能を示すベンチマークデータセット上で優れた性能を発揮すること。
提案手法
- 教師なしの方法でネットワークトラフィック特徴の空間的パターンを抽出するために、マルチスケール畳み込みニューラルネットワークオートエンコーダー(MSCNN-AE)を採用する。
- MSCNN-AEが学習した潜在空間における時間的依存性を、LSTMベースのオートエンコーダーでモデル化する。
- MSCNN-AEとLSTM-AEを統合して、ラベルなしで空間的・時間的表現を同時に学習できる統一されたMSCNN-LSTM-AEアーキテクチャを構築する。
- 2段階の隔離木アルゴリズムを適用し、オートエンコーダーのしきい値ベースの再構成誤差から生じる誤検出(偽陽性・偽陰性)を補正する。
- 入力と再構成されたトラフィックデータの差を最小化する再構成損失を用いて、オートエンコーダーをエンドツーエンドで学習する。
- 再構成誤差を異常スコアとして用い、隔離木を用いて最終分類を最適化することで、精度と再現率を向上させる。
実験結果
リサーチクエスチョン
- RQ1ラベルなしのネットワークトラフィックデータにおいて、統一されたオートエンコーダー・アーキテクチャが空間的および時間的依存性を効果的に捉えられるか?
- RQ2提案されたMSCNN-LSTM-AEモデルは、既存の教師ありおよび教師なしインラインスティクション検出モデルと比較して、再現率とF1スコアにおいてどのように優れているか?
- RQ32段階の隔離木誤検出補正は、オートエンコーダーに基づく異常検出における偽陽性および偽陰性率をどの程度低減するか?
- RQ4NSL-KDD、UNSW-NB15、CICDDoS2019といった多様なベンチマークデータセットにおいて、モデルは一般化性能を示すか?
- RQ5手動ラベリングや広範なハイパーパramータチューニングを必要とせずに、高い検出性能を達成できるか?
主な発見
- 提案されたMSCNN-LSTM-AEモデルは、CICDDoS2019データセットで99.56%の精度、98.91%の適合率、98.81%の再現率、98.46%のF1スコアを達成し、比較表に掲載されたすべてのベースライン手法を上回った。
- NSL-KDDデータセットでは、93.30%の精度、95.75%の適合率、92.33%の再現率、94.01%のF1スコアを達成し、オートエンコーダー(84.21%の精度)やLSTM(82.04%の精度)といった従来の教師なしモデルを著しく上回った。
- UNSW-NB15データセットでは、89%の精度、88%の適合率、89%の再現率、87%のF1スコアを達成し、AdaBoost(86.41%の精度)やExtra Trees(86.73%の精度)といった手法を上回った。
- 隔離木の統合により、偽陽性および偽陰性が低減され、しきい値ベースのオートエンコーダー検出のみと比較してF1スコアと再現率が向上した。
- DOS攻撃が多数含まれるCICDDoS2019のような多様なデータセットにおいても、モデルは頑健な性能を示し、ラベルなしデータや広範なハイパーパramータチューニングを必要とせずに優れた一般化性能を示した。
- 結果から、特にレアまたは複雑な攻撃パターンを検出する上で、MSCNN-LSTM-AEによる空間的・時間的統合モデリングが、高性能な教師なしインラインスティクション検出にとって不可欠であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。