[論文レビュー] Building an Effective Intrusion Detection System using Unsupervised Feature Selection in Multi-objective Optimization Framework
本稿では、相互情報量、標準偏差、情報ゲインを同時に最適化するNSGA-IIを用いた、不正検知システム(IDS)向けの教師なし多目的特徴選択フレームワークを提案する。特徴選択段階でラベル付きデータを一切使用しないにもかかわらず、KDD-99データセットで99.78%の精度、99.27%の検出率、わずか0.2%の誤検出率を達成し、先行研究の最良結果を上回った。
Intrusion Detection Systems (IDS) are developed to protect the network by detecting the attack. The current paper proposes an unsupervised feature selection technique for analyzing the network data. The search capability of the non-dominated sorting genetic algorithm (NSGA-II) has been employed for optimizing three different objective functions utilizing different information theoretic measures including mutual information, standard deviation, and information gain to identify mutually exclusive and a high variant subset of features. Finally, the Pareto optimal front of the different optimal feature subsets are obtained and these feature subsets are utilized for developing classification systems using different popular machine learning models like support vector machines, decision trees and k-nearest neighbour (k=5) classifier etc. We have evaluated the results of the algorithm on KDD-99, NSL-KDD and Kyoto 2006+ datasets. The experimental results on KDD-99 dataset show that decision tree provides better results than other available classifiers. The proposed system obtains the best results of 99.78% accuracy, 99.27% detection rate and false alarm rate of 0.2%, which are better than all the previous results for KDD dataset. We achieved an accuracy of 99.83% for 20% testing data of NSL-KDD dataset and 99.65% accuracy for 10-fold cross-validation on Kyoto dataset. The most attractive characteristic of the proposed scheme is that during the selection of appropriate feature subset, no labeled information is utilized and different feature quality measures are optimized simultaneously using the multi-objective optimization framework.
研究の動機と目的
- 特徴部分集合選択の段階でラベル付きデータに依存しない教師なし特徴選択手法の開発。
- 相互情報量、標準偏差、情報ゲインといった複数の特徴品質指標を同時に最適化し、関連性の向上と重複の低減を図る。
- 最小限の情報量を有する特徴部分集合の選択により計算複雑性を低減し、分類精度を向上させる。
- 標準的なIDSベンチマーク(KDD-99、NSL-KDD、Kyoto 2006+データセット)におけるフレームワークの評価。
- 既存の教師ありおよび単目的特徴選択手法と比較して優れた性能を示すことを実証すること。
提案手法
- 非優位ソーティング遺伝的アルゴリズムII(NSGA-II)を用いて、相互情報量、標準偏差、情報ゲインという3つの特徴品質指標の多目的最適化を実施。
- 情報理論的指標を用いて、関連性が高く、重複が少ない特徴を特定するとともに、サンプル間での高い分散を重視する。
- 進化的な探索により、複数の目的関数のトレードオフをバランスさせるパレート最適な特徴部分集合のフロントを生成。
- 選択された特徴部分集合を、決定木、SVM、k-NN(k=5)といった複数の機械学習分類器に適用し、最終的な分類を実施。
- KDD-99、NSL-KDD、Kyoto 2006+データセットにおいて、10-fold交差検証および標準的なテスト分割を用いた評価を実施。
- フレームワークは完全に教師なしである。特徴選択段階ではクラスラベルは一切使用せず、性能評価の段階でのみ使用される。
実験結果
リサーチクエスチョン
- RQ1ラベル付きデータを使用しない教師なし多目的最適化フレームワークは、IDSにおける特徴部分集合選択を改善できるか?
- RQ2関連性、分散、重複の組み合わせ指標がIDS分類精度にどのように影響するか?
- RQ3提案手法の教師なし特徴選択は、標準的なIDSベンチマークにおいて、既存の教師ありおよび単目的アプローチを上回る性能を示せるか?
- RQ4インシデント検出における特徴部分集合サイズと分類性能の最適なバランスは何か?
- RQ5複数の分類器にわたって、パレート最適な特徴部分集合のフロントを効果的に活用できるか?
主な発見
- 提案手法は、KDD-99データセットで99.78%の精度、99.27%の検出率、わずか0.2%の誤検出率を達成し、このデータセットに関しては、これまでに報告されたすべての結果を上回った。
- NSL-KDDデータセットでは、20%のテスト分割で99.83%の精度を達成し、正常、DoS、Probe、U2R、R2Lの各クラスで99.57%~99.92%のクラス別精度を示した。
- Kyoto 2006+データセットでは、10-fold交差検証を用いて99.65%の精度を達成し、複数のデータセットにわたる強力な一般化性能を示した。
- 最適な特徴部分集合は11~23の特徴で構成され、平均で20の特徴を有しており、KDD-99の元の41特徴と比較して次元削減が顕著に実現された。
- 決定木分類器は、KDD-99データセットにおいて、SVM、k-NNなど他のすべてのモデルと比較して最も優れた性能を示し、最高の精度と検出率を達成した。
- LSTMベースのモデルやヘラジカ最適化を用いた手法ですら、ラベル付きデータや全特徴集合を用いるにもかかわらず、本手法に劣る性能であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。