[论文解读] On Generalisability of Machine Learning-based Network Intrusion Detection Systems
本文研究了基于机器学习的网络入侵检测系统(NIDS)在四个近期发布的基准数据集上的泛化能力。研究发现,没有任何模型能在所有数据集中良好泛化,泛化能力表现出高度的非对称性,且在跨领域设置下,无监督模型优于有监督模型,原因是其依赖于特征-类别对应关系,而这种关系在分布偏移下会失效。
Many of the proposed machine learning (ML) based network intrusion detection systems (NIDSs) achieve near perfect detection performance when evaluated on synthetic benchmark datasets. Though, there is no record of if and how these results generalise to other network scenarios, in particular to real-world networks. In this paper, we investigate the generalisability property of ML-based NIDSs by extensively evaluating seven supervised and unsupervised learning models on four recently published benchmark NIDS datasets. Our investigation indicates that none of the considered models is able to generalise over all studied datasets. Interestingly, our results also indicate that the generalisability has a high degree of asymmetry, i.e., swapping the source and target domains can significantly change the classification performance. Our investigation also indicates that overall, unsupervised learning methods generalise better than supervised learning models in our considered scenarios. Using SHAP values to explain these results indicates that the lack of generalisability is mainly due to the presence of strong correspondence between the values of one or more features and Attack/Benign classes in one dataset-model combination and its absence in other datasets that have different feature distributions.
研究动机与目标
- 研究基于机器学习的NIDS在多个基准数据集上的泛化能力,特别是其在真实世界部署场景中的表现。
- 确定在标准基准上表现优异的模型是否能泛化到未见过的网络环境。
- 在跨数据集评估中,比较有监督与无监督学习模型的性能。
- 利用SHAP值解释模型决策,识别导致泛化能力差的根本原因,涵盖不同数据分布下的模型行为。
- 通过诊断模型可迁移性的失败模式,弥合学术界NIDS研究与实际部署之间的差距。
提出的方法
- 本研究在四个最近发布的、经NetFlow转换的NIDS基准数据集上,评估了七种机器学习模型——四种有监督模型和三种无监督模型,所有数据集具有相同的特征集。
- 每种模型在一个数据集上进行训练,并在全部四个数据集上进行评估,包括训练数据集,以比较单域与多域性能。
- 以双向方式进行交叉评估(源到目标与目标到源),以评估泛化能力的非对称性。
- 计算SHAP(SHapley Additive exPlanations)值,以解释模型预测结果,并识别与攻击或正常流量类别具有强对应关系的特征。
- 使用准确率、检测率和F1分数等标准指标,衡量所有模型-数据集组合的性能表现。
- 对单域与跨域评估结果进行统计比较,以量化泛化性能。
实验结果
研究问题
- RQ1在某一基准数据集上训练的基于机器学习的NIDS模型,能在多大程度上泛化到其他基准数据集?
- RQ2当交换源数据集与目标数据集时,基于机器学习的NIDS模型的泛化能力是否对称?
- RQ3无监督学习模型是否在不同NIDS数据集中表现出优于有监督模型的泛化能力?
- RQ4哪些特征或模型模式可以解释在不同数据分布下泛化能力的缺失?
- RQ5SHAP值如何揭示简单、依赖数据的决策规则的存在,这些规则会阻碍跨领域迁移?
主要发现
- 在评估的七个机器学习模型中,没有一个模型在所有四个基准数据集上均表现出良好泛化能力,表明存在显著的泛化差距。
- 泛化能力表现出高度非对称性:当交换源与目标数据集时,性能显著下降,表明模型迁移存在方向依赖性。
- 尽管单域性能较低,无监督学习模型在跨数据集评估中仍优于有监督模型。
- 在特定数据集-模型组合中取得高性能,主要归因于强而简单的特征-类别对应关系(例如,MAX_TTL值能清晰区分正常与攻击流量)。
- SHAP分析表明,依赖此类单特征规则的模型,在目标数据集的特征分布发生偏移时,无法实现泛化。
- 泛化能力的缺失归因于目标数据集中缺乏一致且强关联的特征-类别关系,即使使用相同的模型和特征也是如此。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。