[论文解读] Evaluation of Machine Learning Algorithms in Network-Based Intrusion Detection System
本文通过在早期数据集上进行训练并在之后的、时间上分离的数据集上进行测试,提出了一种新颖的机器学习网络入侵检测系统(ML-NIDS)评估方法,以评估长期性能并检测过拟合现象。研究发现,SVM 和 ANN 对过拟合的抵抗能力最强,而 DT 和 RF 尽管在训练阶段表现优异,却表现出显著的过拟合,凸显了在真实世界 IDS 评估中采用时间分离数据的重要性。
Cybersecurity has become one of the focuses of organisations. The number of cyberattacks keeps increasing as Internet usage continues to grow. An intrusion detection system (IDS) is an alarm system that helps to detect cyberattacks. As new types of cyberattacks continue to emerge, researchers focus on developing machine learning (ML) based IDS to detect zero-day attacks. Researchers usually remove some or all attack samples from the training dataset and only include them in the testing dataset when evaluating the performance of an IDS on detecting zero-day attacks. Although this method may show the ability of an IDs to detect unknown attacks; however, it does not reflect the long-term performance of the IDS as it only shows the changes in the type of attacks. In this paper, we focus on evaluating the long-term performance of ML based IDS. To achieve this goal, we propose evaluating the ML-based IDS using a dataset that is created later than the training dataset. The proposed method can better assess the long-term performance of an ML-based IDS, as the testing dataset reflects the changes in the type of attack and the changes in network infrastructure over time. We have implemented six of the most popular ML models that are used for IDS, including decision tree (DT), random forest (RF), support vector machine (SVM), naïve Bayes (NB), artificial neural network (ANN) and deep neural network (DNN). Our experiments using the CIC-IDS2017 and the CSE-CIC-IDS2018 datasets show that SVM and ANN are most resistant to overfitting. Besides that, our experiment results also show that DT and RF suffer the most from overfitting, although they perform well on the training dataset. On the other hand, our experiments using the LUFlow dataset have shown that all models can perform well when the difference between the training and testing datasets is small.
研究动机与目标
- 为解决现有 ML-NIDS 评估方法中使用相同数据集进行训练和测试的局限性,该方法无法反映真实世界中的长期性能表现。
- 研究基于机器学习的网络入侵检测系统在训练期后收集的后续数据上的表现,以模拟真实世界中网络流量和攻击模式的时序变化。
- 识别在面对不断演变的网络流量和攻击模式时,哪些机器学习模型对过拟合具有最强的鲁棒性。
- 提出并验证一种新的评估方法,即使用时间上分离的数据集(如以 CIC-IDS2017 作为训练集,CSE-CIC-IDS2018 作为测试集),以更真实地反映实际部署条件。
- 根据组织的威胁特征和基础设施稳定性,为模型选择提供实际指导。
提出的方法
- 作者在早期数据集(如 CIC-IDS2017)上训练六种机器学习模型(DT、RF、SVM、NB、ANN 和 DNN),并在之后、时间上不同的数据集(如 CSE-CIC-IDS2018)上评估其性能,以模拟真实世界中的部署场景。
- 评估使用了两个主要数据集:CIC-IDS2017 和 CSE-CIC-IDS2018,二者在网络拓扑、攻击类型和类别分布方面存在显著差异,从而增强了测试场景的真实性。
- 第二次评估使用了 LUFlow 数据集,其数据采集时间相隔六个月(2020 年 7 月 vs. 2021 年 1 月),以评估在环境变化极小情况下的性能表现。
- 模型性能通过标准指标(如准确率、精确率、召回率和 F1 分数)进行衡量,重点通过训练集与测试集之间的性能下降来检测过拟合现象。
- 通过比较模型在时间与环境差异程度不同的数据集上的行为,评估其鲁棒性。
- 对数据集应用了特征选择,但论文指出,进一步优化特征选择可提升模型的泛化能力。
实验结果
研究问题
- RQ1当在训练数据集之后收集的另一数据集上进行评估时,不同机器学习模型的表现如何?这是否能模拟真实世界中网络流量和攻击的时序演化?
- RQ2在后续、独立的数据集上测试时,哪些机器学习模型对过拟合表现出最强的抵抗能力,表明其具有更好的长期泛化能力?
- RQ3训练集与测试集之间的性能差距在多大程度上揭示了过拟合现象?该差距能否作为模型鲁棒性的可靠指标?
- RQ4当训练集与测试集在攻击类型和网络基础设施方面存在显著差异时,这种选择如何影响模型的泛化能力?
- RQ5对于具有不同威胁特征和基础设施更新频率的组织而言,模型选择具有哪些实际影响?
主要发现
- SVM 和 ANN 在后续数据集上的评估中表现出最强的过拟合抵抗能力,表明其具有更优的长期泛化性能。
- 决策树(DT)和随机森林(RF)模型表现出严重的过拟合现象,其在训练集上准确率很高,但在测试集上的准确率下降至 80% 以下,这在入侵检测系统中被认为是不可接受的。
- 从 CIC-IDS2017 到 CSE-CIC-IDS2018 的性能下降表明,基于旧数据训练的模型无法泛化到更新、更复杂的攻击模式和网络环境中。
- 相比之下,在 LUFlow 数据集上(数据采集时间相隔六个月,但环境变化极小),所有模型均表现良好,表明时间偏移本身并非性能下降的唯一原因。
- 本研究证实,使用相同数据集进行训练和测试的现有 ML-NIDS 评估方法可能无法检测出过拟合现象,因为性能差距仅在使用后续数据集测试时才显现。
- ANN 被确定为适用于频繁更新基础设施且面临高网络攻击风险的系统,而 DT 更适合目标较少、环境稳定的场景,因其效率高且在训练阶段表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。