Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of Machine Learning Algorithms in Network-Based Intrusion Detection System

Tuan-Hong Chua, Iftekhar Salam|arXiv (Cornell University)|Mar 10, 2022
Network Security and Intrusion Detection被引用数 13
ひとこと要約

本論文は、機械学習ベースのネットワークインシデント検出システム(ML-NIDS)の新たな評価手法を提案する。訓練用データセットを過去のものとし、テスト用データセットをその後に得た時系列的に異なるデータセットとして用いることで、長期的な性能と過学習の有無を評価する。研究では、SVMおよびANNが過学習に対して最も強い耐性を示す一方、DTおよびRFは高い訓練性能を示すものの顕著な過学習を示すことが判明し、実世界のIDS評価において時系列的データ分離の重要性が浮き彫りになった。

ABSTRACT

Cybersecurity has become one of the focuses of organisations. The number of cyberattacks keeps increasing as Internet usage continues to grow. An intrusion detection system (IDS) is an alarm system that helps to detect cyberattacks. As new types of cyberattacks continue to emerge, researchers focus on developing machine learning (ML) based IDS to detect zero-day attacks. Researchers usually remove some or all attack samples from the training dataset and only include them in the testing dataset when evaluating the performance of an IDS on detecting zero-day attacks. Although this method may show the ability of an IDs to detect unknown attacks; however, it does not reflect the long-term performance of the IDS as it only shows the changes in the type of attacks. In this paper, we focus on evaluating the long-term performance of ML based IDS. To achieve this goal, we propose evaluating the ML-based IDS using a dataset that is created later than the training dataset. The proposed method can better assess the long-term performance of an ML-based IDS, as the testing dataset reflects the changes in the type of attack and the changes in network infrastructure over time. We have implemented six of the most popular ML models that are used for IDS, including decision tree (DT), random forest (RF), support vector machine (SVM), naïve Bayes (NB), artificial neural network (ANN) and deep neural network (DNN). Our experiments using the CIC-IDS2017 and the CSE-CIC-IDS2018 datasets show that SVM and ANN are most resistant to overfitting. Besides that, our experiment results also show that DT and RF suffer the most from overfitting, although they perform well on the training dataset. On the other hand, our experiments using the LUFlow dataset have shown that all models can perform well when the difference between the training and testing datasets is small.

研究の動機と目的

  • 訓練とテストに同じデータセットを用いる従来のML-NIDS評価手法の限界を是正すること。これは、実世界の長期的性能を反映していない。
  • 訓練期間後に収集されたデータでテストされた際の、ネットワークベースのインシデント検出システムに用いられる機械学習モデルの性能を、実世界の時系列的変化を模擬して調査すること。
  • 進化するネットワークトラフィックおよび攻撃パターンに直面した際、どのMLモデルが過学習に対して最も耐性があるかを特定すること。
  • 時系列的に分離されたデータセット(例:CIC-IDS2017を訓練用、CSE-CIC-IDS2018をテスト用)を用いることで、実世界の展開状況をよりよく反映する新しい評価手法を提案・検証すること。
  • 組織の脅威プロファイルおよびインfra構造の安定性に基づいた、モデル選択に関する実用的指針を提供すること。

提案手法

  • 著者らは、以前のデータセット(例:CIC-IDS2017)で6つのMLモデル(DT、RF、SVM、NB、ANN、DNN)を訓練し、その後に得られた時系列的に異なるデータセット(例:CSE-CIC-IDS2018)でその性能を評価することで、実世界の展開を模擬する。
  • 評価には、ネットワークトポロジー、攻撃タイプ、クラス分布の点で顕著に異なる2つの主要なデータセット(CIC-IDS2017およびCSE-CIC-IDS2018)を用い、テストシナリオの現実性を高めている。
  • 第二の評価として、6か月の時間差で収集されたLUFlowデータセット(2020年7月対2021年1月)を用い、環境要因の変化が最小限の状況下での性能を評価した。
  • モデルの性能は、精度、適合率、再現率、F1スコアといった標準的な指標を用いて測定され、訓練用とテスト用データセット間の性能低下を検出することで過学習の有無を重点的に評価した。
  • 時系列的および環境的要因の差が大きいデータセット間でのモデルの挙動を比較し、耐性の程度を評価した。
  • 特徴量選択がデータセットに適用されたが、論文では特徴量選択のさらなる最適化によりモデルの汎化性能が向上する可能性があると指摘している。

実験結果

リサーチクエスチョン

  • RQ1訓練用データセットとは異なる時期に収集されたデータセットで評価された際、異なる機械学習モデルの性能は、実世界のネットワークトラフィックおよび攻撃の時系列的進化を模擬してどうなるか?
  • RQ2後続の別個のデータセットでテストされた際、どのMLモデルが過学習に対して最も高い耐性を示し、より優れた長期的汎化性能を示すか?
  • RQ3訓練用とテスト用データセット間の性能差が過学習を示す程度はどの程度か。この差は、モデルの耐性の信頼性ある指標として用いられる可能性はあるか?
  • RQ4攻撃タイプやネットワークインfra構造に顕著な差がある訓練用・テスト用データセットを選択した場合、モデルの汎化性能にどのような影響を与えるか?
  • RQ5異なる脅威プロファイルおよびインfra更新頻度を持つ組織にとって、モデル選択にどのような実用的意味合いがあるか?

主な発見

  • SVMおよびANNは、後続のデータセットで評価された際、過学習に対して最も強い耐性を示し、優れた長期的汎化性能を示していることが判明した。
  • 決定木(DT)およびランダムフォレスト(RF)モデルは著しい過学習を示し、訓練セットでは高い精度を達成したが、テストセットでは80%未満に低下しており、インシデント検出の文脈では許容できない水準である。
  • CIC-IDS2017からCSE-CIC-IDS2018に移行する際の性能低下は、過去のデータで訓練されたモデルが、より新しい複雑な攻撃パターンおよびネットワーク環境に一般化できないことを示している。
  • これに対して、LUFlowデータセット(6か月の時間差だが環境的変化が最小限)で訓練されたモデルは、すべてのモデルで良好な性能を示した。これは、時間的シフトそのものが性能低下の唯一の要因ではないことを示唆している。
  • 本研究は、訓練とテストに同じデータセットを用いる従来のML-NIDS評価では、過学習が検出されない可能性があることを確認した。性能差は、後続のデータセットでテストした際のみ顕在化する。
  • ANNは、頻繁なインfra更新と高いサイバー攻撃リスクを有するシステムに最適なモデルであると特定された。一方、DTは、低標的で安定した環境に適しており、効率性と高い訓練性能を発揮するための優れた選択肢である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。