Skip to main content
QUICK REVIEW

[论文解读] Bridging the gap to real-world for network intrusion detection systems with data-centric approach

Gustavo de Carvalho Bertoli, Lourenço Alves Pereira|arXiv (Cornell University)|Oct 25, 2021
Network Security and Intrusion Detection参考文献 17被引用 4
一句话总结

本文提出一种以数据为中心的框架,通过结合实时公开的 MAWILab 正常流量与按需生成的虚拟化攻击流量(使用 Kali Linux 容器),生成最新、带标签的网络入侵检测(NIDS)数据集。该方法生成了一个可复现、带标签的数据集,共包含 835,941 个数据包,其中 54% 为攻击样本(22 种端口扫描类别),46% 为正常流量,解决了基于机器学习的 NIDS 研究中数据集老化和现实适用性不足的问题。

ABSTRACT

Most research using machine learning (ML) for network intrusion detection systems (NIDS) uses well-established datasets such as KDD-CUP99, NSL-KDD, UNSW-NB15, and CICIDS-2017. In this context, the possibilities of machine learning techniques are explored, aiming for metrics improvements compared to the published baselines (model-centric approach). However, those datasets present some limitations as aging that make it unfeasible to transpose those ML-based solutions to real-world applications. This paper presents a systematic data-centric approach to address the current limitations of NIDS research, specifically the datasets. This approach generates NIDS datasets composed of the most recent network traffic and attacks, with the labeling process integrated by design.

研究动机与目标

  • 解决因 KDD-CUP99 和 CICIDS-2017 等老旧数据集导致的 NIDS 研究关键缺口,这些数据集限制了现实世界的应用性。
  • 通过将重点从模型为中心转向持续、以数据驱动的数据集生成,克服模型中心方法的局限性,以反映当前网络流量与不断演变的攻击模式。
  • 开发一种可复现、系统化的框架,利用真实、最新的正常流量与按需攻击模拟,生成带标签的 NIDS 数据集。
  • 通过持续使用最新数据进行模型微调,应对概念漂移问题,并提升在多样化网络架构中的泛化能力。
  • 提供一个公开可用、开源的数据集生成流水线,以支持未来研究与实际部署。

提出的方法

  • 使用 Docker 容器运行 Kali Linux,对基于云的目标实例按需生成可复现的攻击流量。
  • 部署基于 UDP 的命令与控制机制,触发目标云实例上的数据包捕获(使用 tcpdump),并通过攻击者 IP 过滤实现精确标注。
  • 从多个云实例收集并合并网络流量文件,每个文件均标注攻击类型与时间戳,形成统一的攻击数据集。
  • 将最新、公开可用的 MAWILab 流量(来自跨太平洋主干网的每日 15 分钟追踪)作为正常流量来源。
  • 对 MAWILab 数据进行预处理,过滤掉被标记为异常或可疑的报文,随后应用随机采样以平衡数据集并减少类别不平衡。
  • 将处理后的正常流量与攻击流量数据集合并为一个统一、整洁、带标签的数据集,包含 41 个特征(报文内在属性与上下文感知属性),确保与无状态分析的兼容性。

实验结果

研究问题

  • RQ1能否通过以数据为中心的方法生成反映当前网络流量与不断演变攻击模式的最新、带标签的 NIDS 数据集,从而克服老旧基准数据集的局限性?
  • RQ2如何设计一种系统化、可复现的流水线,用于生成带标签的攻击流量,并将其与真实正常网络流量整合,以支持 NIDS 研究?
  • RQ3所提出的框架在多大程度上可通过持续生成数据集与模型微调来应对 NIDS 中的概念漂移问题?
  • RQ4将真实、最新正常流量(MAWILab)与合成攻击流量相结合,如何提升数据集的真实感与泛化潜力?
  • RQ5受控采样与标注对类别分布及不平衡 NIDS 数据集中模型性能的影响如何?

主要发现

  • 该框架成功生成了一个包含 835,941 个数据包的带标签 NIDS 数据集,其中 54% 被分类为攻击(22 种不同的端口扫描类别),46% 为正常流量。
  • 攻击数据集包含来自 22 种不同 TCP 端口扫描技术、针对 4 个基于云的实例的 455,503 个带标签样本。
  • 正常数据集源自 2020 年 11 月 10 日与 11 月 29 日的 MAWILab 追踪数据,经过滤掉异常与可疑流量后,得到 380,438 个正常样本。
  • 通过随机采样实现数据集平衡,获得受控的 46% 正常 / 54% 攻击分布,有效缓解类别不平衡问题。
  • 数据集包含 41 个特征,结合了报文内在属性与上下文感知属性,适用于无状态 NIDS 分析。
  • 整个流水线(包括攻击生成与数据收集)均可复现,并通过 AB-TRAP GitHub 仓库公开提供。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。