[论文解读] Data Mining with Big Data in Intrusion Detection Systems: A Systematic Literature Review
本篇系统性文献回顾分析了2013至2018年间32项关于大数据环境下的入侵检测系统(IDS)中数据挖掘技术(DMTs)的研究,识别出决策树、贝叶斯网络、k-means、SVM和人工神经网络(ANN)为最常用的DMTs。研究发现,Spark在实时性能方面优于Hadoop,但66%的实验仍依赖于DARPA等过时的数据集,限制了检测准确率和实时攻击分类能力。
Cloud computing has become a powerful and indispensable technology for complex, high performance and scalable computation. The exponential expansion in the deployment of cloud technology has produced a massive amount of data from a variety of applications, resources and platforms. In turn, the rapid rate and volume of data creation has begun to pose significant challenges for data management and security. The design and deployment of intrusion detection systems (IDS) in the big data setting has, therefore, become a topic of importance. In this paper, we conduct a systematic literature review (SLR) of data mining techniques (DMT) used in IDS-based solutions through the period 2013-2018. We employed criterion-based, purposive sampling identifying 32 articles, which constitute the primary source of the present survey. After a careful investigation of these articles, we identified 17 separate DMTs deployed in an IDS context. This paper also presents the merits and disadvantages of the various works of current research that implemented DMTs and distributed streaming frameworks (DSF) to detect and/or prevent malicious attacks in a big data environment.
研究动机与目标
- 识别并分析2013至2018年间在大数据环境中用于入侵检测系统(IDS)的数据挖掘技术(DMTs)。
- 评估现有IDS解决方案中所采用的DMT和分布式流处理框架(DSF)的优势与劣势。
- 检查用于验证DMT在IDS中性能的评估指标,评估基准测试中的不一致性。
- 调查所审查IDS针对的网络攻击类型,以及实验中使用的数据集特征。
- 为未来研究提供建议,强调实时检测、现代数据集以及采用高性能大数据工具(如Spark)的重要性。
提出的方法
- 依据Kitchenham和Charters的框架开展系统性文献回顾(SLR),涵盖规划、执行和报告三个阶段。
- 在六个数字图书馆(IEEE Xplore、ACM、Web of Science、Elsevier、Springer、Wiley)中检索,最初获得545篇文献。
- 应用纳入/排除标准和质量评估规则筛选相关研究,最终确定32篇主要文献用于分析。
- 对IDS中使用的DMT进行分类,包括决策树、贝叶斯网络、k-means、SVM和人工神经网络,并评估主成分分析(PCA)与卡方检验等特征选择(FS)技术。
- 分析Hadoop、Spark和Storm等分布式流处理框架(DSF),比较其在实时入侵检测中的性能表现。
- 映射各研究中使用的评估指标(如TPR、准确率、FPR、TST、TRT)及攻击分类能力,以识别不一致性和研究空白。
实验结果
研究问题
- RQ1在大数据环境中,哪些数据挖掘技术被应用于IDS?
- RQ2文献中所采用的DMT和DSF具有哪些优势与劣势?
- RQ3用于验证DMT在IDS中性能的评估指标有哪些?
- RQ4文献中的IDS针对哪些类型的攻击?所使用数据集的特征是什么?
主要发现
- 在大数据IDS中,最常使用的数据挖掘技术为决策树、贝叶斯网络、k-means聚类、人工神经网络(ANN)和支撑向量机(SVM)。
- 主成分分析(PCA)是最常使用的特征选择(FS)技术,但66%的研究未采用FS,可能降低系统效率。
- Hadoop是使用最广泛的分布式流处理框架(DSF),但Spark在实时处理和可扩展性方面表现出更优性能。
- 最常报告的评估指标为真阳性率(TPR)、准确率(Acc)和假阳性率(FPR),用于衡量效率;总处理时间(TST)、通信成本(CC)和总响应时间(TRT)用于衡量性能。
- 66%的实验使用了过时的DARPA数据集,可能影响所提IDS解决方案的泛化能力与实际应用效果。
- 多数研究将攻击分类为正常或恶意两类,缺乏实时分类具体攻击类型的能力,表明在细粒度攻击检测方面存在关键空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。