Skip to main content
QUICK REVIEW

[論文レビュー] Outlier detection on network flow analysis

Quang-Vinh Dang|arXiv (Cornell University)|Aug 6, 2018
Anomaly Detection Techniques and Applications参考文献 1被引用数 9
ひとこと要約

本稿では、ラベルのない訓練データを用いずにDDoS攻撃を同定するための教師なし外れ値検出アルゴリズムの有効性を、ラベルの不均衡を示す実世界のデータセットを用いて評価している。隔離木(Isolation Forest)とPCAベースの手法が他の手法を上回り、特に外れ値割合が低い状況でも高いAUCと正答率を示しており、訓練用ラベルが不要な状況でも強力な性能を発揮している。

ABSTRACT

It is important to be able to detect and classify malicious network traffic flows such as DDoS attacks from benign flows. Normally the task is performed by using supervised classification algorithms. In this paper we analyze the usage of outlier detection algorithms for the network traffic classification problem.

研究の動機と目的

  • 教師なし外れ値検出アルゴリズムが、ラベル付きの訓練データに依存せずにDDoS攻撃を同定する効果を評価すること。
  • 特に未知の攻撃タイプへの一般化性能が低く、クラスの不均衡に敏感な教師あり分類手法の限界を是正すること。
  • 悪性と健全なネットワークフローの比率を変化させた状況下、特に極端な不均衡(例:1:1000)において、アルゴリズムの性能を評価すること。
  • 76の特徴と正解ラベルを備えた実際のネットワークフロー・データ上で、複数の外れ値検出手法を比較すること。
  • 攻撃トラフィックの割合が低い状況でも高い検出性能を維持できるアルゴリズムを特定すること。

提案手法

  • 7つの教師なし外れ値検出アルゴリズム(CBLOF, HBOS, Isolation Forest(IForest), k-NN, MCD, OCSVM, PCA)を適用した。
  • フロー持続時間、パケット数、パケット長の統計などの76の特徴を含む、実際のネットワークフロー・データセット(464,976サンプル)を用いた。
  • クラスの分布を制御するためのカスタム関数を用いて、健全なフローと攻撃フローをサブサンプリングすることで、攻撃割合が0.01%から99%までの合成データセットを作成した。
  • 各データセットを70%の訓練データと30%のテストデータに分割し、サンプル全体で同一の値を取る特徴が存在しないようにした。
  • AUCスコアと正答率スコアを用いて性能を評価し、訓練データとテストデータの結果を比較することで一般化性能を評価した。
  • ネットワークセキュリティで一般的な極端な不均衡状況を再現するために、健全なデータの比率を変化させた条件で結果を報告した。

実験結果

リサーチクエスチョン

  • RQ1データセットが極めて不均衡な状況下で、教師なし外れ値検出アルゴリズムはDDoS攻撃をどの程度効果的に検出できるか?
  • RQ2ネットワークフロー・データにおけるさまざまな攻撃割合において、どの外れ値検出アルゴリズムが最高のAUCと正答率を達成するか?
  • RQ3訓練データとテストデータにおける外れ値検出アルゴリズムの性能の違いは、一般化能力を示唆するか?
  • RQ4外れ値検出手法は、訓練時にラベル付き例が不要な状況でも、未観測のDDoS攻撃パターンを検出できるか?
  • RQ5攻撃トラフィックの割合(攻撃割合)が、さまざまな外れ値検出アルゴリズムの検出性能にどのように影響を与えるか?

主な発見

  • 隔離木(IForest)とPCAベースの外れ値検出が、全テスト攻撃割合において最高のAUCスコアを達成し、特に健全なトラフィックの割合が増加するにつれて顕著に優れた性能を示した。
  • IForestとPCAのAUCスコアは、極めて低い攻撃割合(例:0.01%)でも一貫して高く維持されており、極端なクラス不均衡状況下でも優れた性能を示した。
  • 全アルゴリズムにおいて、健全なデータの比率が高くなるにつれて正答率スコアが上昇し、クラス不均衡が性能指標に与える影響を確認した。
  • 全アルゴリズムにおいて、訓練データとテストデータの性能が非常に類似しており、教師なし手法が訓練データに過剰適合せず、良好に一般化していることを示した。
  • データセットには3.76%(464,976中17,462)の攻撃サンプルが含まれており、本研究では0.01%から99%までの比率をカバーして、実世界の状況を再現した。
  • IForestやPCAのような外れ値検出手法は、攻撃の発生頻度が低く、攻撃パターンが未知の状況下で、従来の教師あり分類器を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。