Skip to main content
QUICK REVIEW

[论文解读] IGRF-RFE: A Hybrid Feature Selection Method for MLP-based Network Intrusion Detection on UNSW-NB15 Dataset

Yuhua Yin, Julian Jang‐Jaccard|arXiv (Cornell University)|Mar 30, 2022
Network Security and Intrusion Detection被引用 14
一句话总结

该论文提出IGRF-RFE,一种混合特征选择方法,结合信息增益(IG)和随机森林(RF)过滤方法,并以递归特征消除(RFE)作为MLP-based网络入侵检测的包装器,应用于UNSW-NB15数据集。该方法将特征数从42个减少至23个,将MLP分类准确率从82.25%提升至84.24%,同时将F1分数提升至82.85%。

ABSTRACT

The effectiveness of machine learning models is significantly affected by the size of the dataset and the quality of features as redundant and irrelevant features can radically degrade the performance. This paper proposes IGRF-RFE: a hybrid feature selection method tasked for multi-class network anomalies using a Multilayer perceptron (MLP) network. IGRF-RFE can be considered as a feature reduction technique based on both the filter feature selection method and the wrapper feature selection method. In our proposed method, we use the filter feature selection method, which is the combination of Information Gain and Random Forest Importance, to reduce the feature subset search space. Then, we apply recursive feature elimination(RFE) as a wrapper feature selection method to further eliminate redundant features recursively on the reduced feature subsets. Our experimental results obtained based on the UNSW-NB15 dataset confirm that our proposed method can improve the accuracy of anomaly detection while reducing the feature dimension. The results show that the feature dimension is reduced from 42 to 23 while the multi-classification accuracy of MLP is improved from 82.25% to 84.24%.

研究动机与目标

  • 为解决高维网络数据集中冗余和无关特征导致的MLP-based入侵检测性能下降问题。
  • 通过特征选择提高多类别网络异常检测的检测准确率并减少误报。
  • 开发一种混合特征选择方法,结合过滤方法的速度优势与包装方法的相关性感知优化能力。
  • 在真实数据划分条件下,于标准UNSW-NB15数据集上验证所提方法的有效性。

提出的方法

  • 第一阶段采用结合信息增益(IG)和随机森林(RF)的混合过滤方法,根据特征重要性对初始特征集进行排序与降维。
  • 将IG和RF选出的顶部特征的交集用于形成精炼的特征子集,以最小化仅由IG单独选择的高频低影响特征的影响。
  • 第二阶段使用MLP分类器作为包装器,应用递归特征消除(RFE)迭代移除相关性较低的特征,以识别最优特征子集。
  • 该方法引入一个耐心参数(p),实现早期停止,从而在不损失性能的前提下降低计算成本。
  • 保留分类特征,并与所选数值特征结合,形成最终的特征子集。
  • 最终的特征子集用于训练MLP模型,性能通过多类别分类指标(包括准确率、F1分数、精确率和召回率)进行评估。

实验结果

研究问题

  • RQ1混合过滤-包装特征选择方法是否能提升MLP-based网络入侵检测在UNSW-NB15数据集上的性能?
  • RQ2将IG与RF过滤方法结合,相较于单独使用任一方法,能否更有效地提升特征相关性?
  • RQ3在初始基于过滤方法的降维后,基于RFE的包装选择在多大程度上提升了分类准确率?
  • RQ4所提出的IGRF-RFE方法是否在相同数据集和模型上优于独立的IG、RF或其他现有特征选择技术?
  • RQ5使用MLP进行高性能多类别网络异常检测所需的最优特征数量是多少?

主要发现

  • IGRF-RFE将特征集从42个减少至23个,多类别分类准确率从82.25%显著提升至84.24%。
  • 该方法实现了82.85%的加权F1分数,优于独立的IG(81.49%)和RF(81.62%)特征选择方法。
  • 在过滤阶段结合IG与RF有效缓解了仅使用IG时对高频但低影响特征的过度选择问题。
  • IGRF-RFE在相同数据集上优于其他使用MLP的类似工作,包括采用XGBoost、WFEU和基于决策树的方法。
  • 即使与准确率更高(如95.2%)但使用更大或不同划分方式数据集的模型相比,该方法仍表现出稳健性和竞争力。
  • IGRF-RFE的计算复杂度保持在O(n²),与标准RFE相当,且通过耐心参数实现的早期停止显著提升了资源效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。