Skip to main content
QUICK REVIEW

[論文レビュー] On generating network traffic datasets with synthetic attacks for intrusion detection

Carlos García Cordero, Emmanouil Vasilomanolakis|arXiv (Cornell University)|May 1, 2019
Network Security and Intrusion Detection被引用数 4
ひとこと要約

この論文では、本物のバックグラウンドネットワークトラフィックに現実的でラベル付きの攻撃を挿入することで、合成されたネットワーク攻撃トラフィックを生成するオープンソースのツールキットID2Tを紹介する。元のトラフィックの統計的性質を保持することで検出不能性を確保する。主な貢献は、古くさいや個人情報が含まれるデータセットに依存せず、再現可能でプライバシーを守る高精細なインシデント検出データセットの作成手法である。

ABSTRACT

Most research in the area of intrusion detection requires datasets to develop, evaluate or compare systems in one way or another. In this field, however, finding suitable datasets is a challenge on to itself. Most publicly available datasets have negative qualities that limit their usefulness. In this article, we propose ID2T (Intrusion Detection Dataset Toolkit) to tackle this problem. ID2T facilitates the creation of labeled datasets by injecting synthetic attacks into background traffic. The injected synthetic attacks blend themselves with the background traffic by mimicking the background traffic's properties to eliminate any trace of ID2T's usage. This work has three core contribution areas. First, we present a comprehensive survey on intrusion detection datasets. In the survey, we propose a classification to group the negative qualities we found in the datasets. Second, the architecture of ID2T is revised, improved and expanded. The architectural changes enable ID2T to inject recent and advanced attacks such as the widespread EternalBlue exploit or botnet communication patterns. The toolkit's new functionality provides a set of tests, known as TIDED (Testing Intrusion Detection Datasets), that help identify potential defects in the background traffic into which attacks are injected. Third, we illustrate how ID2T is used in different use-case scenarios to evaluate the performance of anomaly and signature-based intrusion detection systems in a reproducible manner. ID2T is open source software and is made available to the community to expand its arsenal of attacks and capabilities.

研究の動機と目的

  • 長年にわたり、信頼性が低く、古くさかったり、不完全な公開されたインシデント検出データセットの問題に対処すること。
  • 既存のデータセットの制限、例えば古くなったトラフィック特性、ラベルなし攻撃、プライバシー懸念を克服すること。
  • 合成攻撃を含むラベル付きネットワークトラフィックデータセットを生成する再現可能で拡張可能なフレームワークを提供すること。
  • 研究者が機密または特許情報に依存せずに、現代的で現実的なトラフィック上でインシデント検出システム(NIDS)を評価できるようにすること。
  • 現在のネットワーク行動や新たな脅威、たとえばEternalBlueやボットネット通信パターンを反映したデータセットの作成を支援すること。

提案手法

  • 本物のバックグラウンドトラフィックに合成攻撃を挿入するためのツールキットを用い、元のトラフィックの統計的性質を模倣することで検出を回避する。
  • EternalBlueの攻撃やボットネット通信パターンを含む、現代的で高度な攻撃をサポートするように、ID2Tアーキテクチャを改訂・拡張する。
  • 攻撃挿入の前段階でバックグラウンドトラフィックの品質と現実性を検証する新しいテストモジュールTIDEDを統合する。
  • TIDEDを用いて、期待されるネットワーク特性(例:バックボーンネットワーク動作)と一致しない欠陥を検出する。
  • 研究者がバックグラウンドトラフィックと攻撃パラメータを指定することで、実験間での再現性を確保できるようにデータセットをカスタマイズ可能にする。
  • 既知のシグネチャや行動パターンに基づく検出が可能な攻撃を生成することで、異常検知型およびシグネチャベースのNIDS評価を両方可能にする。

実験結果

リサーチクエスチョン

  • RQ1本物のバックグラウンドトラフィックの統計的性質を保持する方法で、検出不能に合成ネットワーク攻撃トラフィックを生成するにはどうすればよいか?
  • RQ2既存の公開インシデント検出データセットの主な欠陥は何か。それらを体系的に分類し、是正するにはどうすればよいか?
  • RQ3ID2Tのようなツールキットは、静的データセットに依存せず、異なる時期やネットワーク状態においてNIDSの再現可能評価を可能にするか?
  • RQ4ID2Tは、現在の脅威環境を反映した、EternalBlueやボットネットC&Cトラフィックなどの現実的で現代的な攻撃をどの程度正確に生成できるか?
  • RQ5ネットワークレベルの副作用(再送信やウィンドウサイズの変更など)を考慮した場合、攻撃とバックグラウンドトラフィックの相互作用をどのようにモデル化すれば、より現実的にできるか?

主な発見

  • ID2Tは、バックグラウンドトラフィックの統計的性質を再現することで、合成攻撃をバックグラウンドトラフィックに自然に融合させ、ツールキットそのものの存在が検出不能になることを確認した。
  • TIDEDモジュールは、期待されるバックボーンネットワーク動作と乖離しているなど、バックグラウンドトラフィックの欠陥を効果的に特定し、攻撃挿入前のデータセット品質を向上させた。
  • ID2Tを用いることで、過去のNIDS評価結果(例:RNNベースの検出)を現代のネットワークトラフィック上で再現可能であり、時間的跨ぎ評価の有効性を示した。
  • シグネチャベースのNIDS、たとえばBroやSuricataは、ID2Tで挿入された期待される攻撃を正常に検出できた。これにより、ID2Tが実稼働システムの挙動を検証する有効性を裏付けた。
  • ID2Tは、EternalBlueやボットネット通信といった高度で現代的な攻撃の挿入をサポートしており、現在の脅威モデルへの関連性を拡大した。
  • ツールキットは、静的データセットの代替としてスケーラブルでプライバシーを守る選択肢を提供し、データ共有や匿名化の問題を抱えずに、研究者がオンデマンドでカスタムでラベル付きデータセットを生成できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。