Skip to main content
QUICK REVIEW

[論文レビュー] Bridging the gap to real-world for network intrusion detection systems with data-centric approach

Gustavo de Carvalho Bertoli, Lourenço Alves Pereira|arXiv (Cornell University)|Oct 25, 2021
Network Security and Intrusion Detection参考文献 17被引用数 4
ひとこと要約

本稿では、Kali Linuxコンテナを用いたオンデマンドで仮想化された攻撃トラフィックと、リアルタイムで公開されているMAWILabの健全なトラフィックを組み合わせることで、最新でラベル付きのネットワークインシデント検出(NIDS)データセットを生成するデータ中心のフレームワークを提案する。このアプローチにより、機械学習ベースのNIDS研究におけるデータセットの陳腐化と現実世界への適用性のギャップを解消し、835,941パケットの再現可能でラベル付きのデータセット(攻撃サンプルが54%(22種類のポートスキャンクラス)、健全なトラフィックが46%)を生成した。

ABSTRACT

Most research using machine learning (ML) for network intrusion detection systems (NIDS) uses well-established datasets such as KDD-CUP99, NSL-KDD, UNSW-NB15, and CICIDS-2017. In this context, the possibilities of machine learning techniques are explored, aiming for metrics improvements compared to the published baselines (model-centric approach). However, those datasets present some limitations as aging that make it unfeasible to transpose those ML-based solutions to real-world applications. This paper presents a systematic data-centric approach to address the current limitations of NIDS research, specifically the datasets. This approach generates NIDS datasets composed of the most recent network traffic and attacks, with the labeling process integrated by design.

研究の動機と目的

  • KDD-CUP99 や CICIDS-2017 といった陳腐化したデータセットが、現実世界への適用性を制限するNIDS研究における重要なギャップを解消する。
  • モデル中心のアプローチの限界を克服し、現在のネットワークトラフィックと進化する攻撃パターンを反映する継続的・データ駆動型のデータセット生成に焦点を移す。
  • 実際の最新の健全なトラフィックとオンデマンドで生成される攻撃シミュレーションを用いて、再現可能で体系的なラベル付きNIDSデータセット生成フレームワークを構築する。
  • 概念ずれ(concept drift)に対処し、多様なネットワークアーキテクチャにわたる一般化性能を向上させるために、継続的なモデル再訓練を可能にする。
  • 今後の研究および現実世界への展開を支援するため、公開可能でオープンソースのパイプラインを提供する。

提案手法

  • Kali Linuxコンテナを用いて、クラウドベースのターゲットインスタンスに対してオンデマンドで再現可能な攻撃トラフィックを生成する。
  • 攻撃者IPフィルタリングによる正確なラベリングを保証するため、UDPベースのコマンドアンドコントロールメカニズムを導入し、ターゲットクラウドインスタンスでパケットキャプチャ(tcpdumpを用いて)を実行する。
  • 複数のクラウドインスタンスからのトラフィックファイルを収集・統合し、各インスタンスを攻撃タイプとタイムスタンプでラベル付けすることで、統合された攻撃データセットを構築する。
  • 健全なトラフィックソースとして、最新で公開されているMAWILabトラフィック(太平洋を横断するバックボーンからの15分ごとのトレース)を統合する。
  • 異常または懸念されるトラフィックと見なされるパケットを除外するため、MAWILabデータを前処理し、その後ランダムサンプリングを適用してデータセットのバランスをとる。
  • 前処理済みの健全なトラフィックと攻撃トラフィックデータセットを統合し、41の特徴量(パケット固有およびコンテキストに依存する)を持つ、一貫性がありラベル付きの単一データセットを構築する。これにより、ステートレス分析との互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1データ中心のアプローチは、陳腐化したベンチマークデータセットの限界を克服し、最新のネットワークトラフィックと進化する攻撃パターンを反映する最新でラベル付きのNIDSデータセットを生成できるか?
  • RQ2体系的かつ再現可能なパイプラインをどのように設計すれば、ラベル付き攻撃トラフィックの生成と実際の健全なネットワークトラフィックとの統合が可能になるか?
  • RQ3本フレームワークは、継続的なデータセット生成とモデル再訓練を可能にすることで、NIDSにおける概念ずれをどの程度解消できるか?
  • RQ4実際の最新の健全なトラフィック(MAWILab)と合成攻撃トラフィックを統合することで、データセットの現実性と一般化可能性はどの程度向上するか?
  • RQ5制御されたサンプリングとラベリングは、不均衡なNIDSデータセットにおけるクラス分布とモデル性能にどのような影響を与えるか?

主な発見

  • 本フレームワークにより、835,941パケットのラベル付きNIDSデータセットが正常に生成され、そのうち54%が攻撃(22種類のポートスキャンクラス)と分類され、残り46%が健全なトラフィックであった。
  • 攻撃データセットは、4つのクラウドインスタンスを標的とした22種類のTCPポートスキャン手法から得られた455,503件のラベル付きサンプルから構成されている。
  • 健全なデータセットは、2020年11月10日および11月29日に収集されたMAWILabトレースから、異常または懸念されるトラフィックを除外した後、380,438件の健全なサンプルが得られた。
  • 最終的なデータセットはランダムサンプリングによりバランスがとられ、クラス不均衡を軽減するための制御された46%の健全/54%の攻撃の分布が達成された。
  • データセットには、ステートレスNIDS分析に適したパケット固有およびコンテキストに依存する属性を組み合わせた41の特徴量が含まれている。
  • 攻撃生成とデータ収集を含む、すべてのパイプラインが再現可能であり、AB-TRAP GitHubリポジトリを通じて公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。