[論文レビュー] Towards the Development of Realistic Botnet Dataset in the Internet of Things for Network Forensic Analytics: Bot-IoT Dataset
本稿では、多様な攻撃シナリオを含む制御されたテストベッドを用いて作成された、実用的で良好にラベル付けされたIoTボットネットフォレンジックスのためのネットワークトラフィックデータセット、Bot-IoTデータセットを紹介する。SVMおよびディープラーニングモデルを用いた高い検出性能が示され、最大99.99%の正確性とほぼ完璧に近いF1スコアを達成しており、IoTネットワークにおけるボットネット検出のベンチマークを確立している。
The proliferation of IoT systems, has seen them targeted by malicious third parties. To address this, realistic protection and investigation countermeasures need to be developed. Such countermeasures include network intrusion detection and network forensic systems. For that purpose, a well-structured and representative dataset is paramount for training and validating the credibility of the systems. Although there are several network, in most cases, not much information is given about the Botnet scenarios that were used. This paper, proposes a new dataset, Bot-IoT, which incorporates legitimate and simulated IoT network traffic, along with various types of attacks. We also present a realistic testbed environment for addressing the existing dataset drawbacks of capturing complete network information, accurate labeling, as well as recent and complex attack diversity. Finally, we evaluate the reliability of the BoT-IoT dataset using different statistical and machine learning methods for forensics purposes compared with the existing datasets. This work provides the baseline for allowing botnet identificaiton across IoT-specifc networks. The Bot-IoT dataset can be accessed at [1].
研究の動機と目的
- ネットワークフォレンジック分析のための、現実的で良好にラベル付けされ、多様なIoTボットネットデータセットの不足に対処すること。
- 完全なネットワークトラフィックを記録し、攻撃タイプを正確にラベル付けできる再現可能で現実的なテストベッド環境を構築すること。
- 通常のIoTトラフィックと、DDoS、DoS、データ漏洩、キーロギングを含む複数のボットネット攻撃シナリオを含む代表的なデータセットを生成すること。
- 統計的分析と機械学習モデルを用いて、データセットの信頼性を評価し、既存のデータセットと比較して性能を検証すること。
- IoT環境における高度なボットネット検出システムの訓練および検証の基盤となるデータセットを提供すること。
提案手法
- センサー、ゲートウェイ、制御システムを含む100台以上のデバイスを備えた現実的なIoTテストベッドの設計。実際のIoTネットワークトポロジーを模倣する。
- MiraiやDDoSツールなどの複数のボットネットツールをデプロイし、DDoS TCP/UDP、DoS HTTP、データ漏洩などの多様な攻撃シナリオをシミュレートする。
- 攻撃タイプとサブカテゴリごとに整理された生のパケットキャプチャ(PCAP)を収集し、攻撃カテゴリーやサブカテゴリをメタデータでラベル付けする。
- 継続時間、パケット数、バイト数、プロトコル固有のメトリクスを含むネットワークフロー単位の統計を用いた特徴抽出。
- 相関係数と結合エントロピーを用いた統計的手法を適用し、最も情報量の多い特徴を特定し、次元削減を実施する。
- フル特徴量と10番目の最良特徴量のサブセットを用いて、SVM、RNN、LSTMなどの機械学習モデルを訓練および評価し、検出性能を評価する。
実験結果
リサーチクエスチョン
- RQ1フォレンジック分析のための代表的で再現可能なIoTテストベッドを構築し、代表的なボットネットトラフィックを生成することは可能か?
- RQ2Bot-IoTデータセットは、機械学習モデルを用いて多様なIoTボットネット攻撃を高精度に検出可能か?
- RQ3特徴選択(例:10番目の最良特徴)は、モデルの性能および学習効率にどのような影響を与えるか?
- RQ4攻撃の多様性、ラベル付けの正確性、統計的信頼性の観点から、Bot-IoTデータセットは既存のデータセットと比べてどのように差別化されるか?
- RQ5ディープラーニングモデル(RNN、LSTM)は、最小限の誤検出を伴いながら、IoT固有のボットネットトラフィックに対して高い検出性能を達成できるか?
主な発見
- フル特徴量データセットで訓練されたSVMモデルは、二値分類において最高の正確性(0.99998645)と再現率(0.99999226)を達成した。
- 10番目の最良特徴量を用いたSVMモデルは、二値分類において最高の適合率(0.99999419)と最小の誤検出率(0.01257862)を達成した。
- RNNおよびLSTMモデルは、すべての攻撃サブカテゴリで高い正確性(0.987以上)とF1スコア(0.98以上)を達成し、DDoS TCPサブカテゴリでは97.7%のF1スコアを達成した。
- データ漏洩攻撃は最も低いパフォーマンス指標を示し、適合率が0.98529412、再現率が0.91780822であった。これは、低・中程度のトラフィック量攻撃の検出に課題があることを示している。
- データセットサイズが大きくなるにつれて学習時間が延長され、テストされたモデルの中でDoS UDP-Normalトラフィックが最も長い学習時間(38.74秒)を要した。
- 混同行列は、特にフル特徴量データを用いたRNNおよびLSTMモデルにおいて、大多数の攻撃タイプで高い真正陽性率と低い偽陽性率を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。