[论文解读] An Interpretable Federated Learning-based Network Intrusion Detection Framework
该论文提出FedForest,一种基于联邦学习的新型网络入侵检测框架,结合梯度提升决策树(GBDT)与联邦学习,实现隐私保护、可解释性及可扩展的入侵检测。通过在客户端本地训练GBDT模型并在中央服务器聚合,FedForest在多种网络攻击任务中实现高准确率,同时支持对未知攻击的实时检测,并通过差分隐私和机器遗忘技术增强隐私保护。
Learning-based Network Intrusion Detection Systems (NIDSs) are widely deployed for defending various cyberattacks. Existing learning-based NIDS mainly uses Neural Network (NN) as a classifier that relies on the quality and quantity of cyberattack data. Such NN-based approaches are also hard to interpret for improving efficiency and scalability. In this paper, we design a new local-global computation paradigm, FEDFOREST, a novel learning-based NIDS by combining the interpretable Gradient Boosting Decision Tree (GBDT) and Federated Learning (FL) framework. Specifically, FEDFOREST is composed of multiple clients that extract local cyberattack data features for the server to train models and detect intrusions. A privacy-enhanced technology is also proposed in FEDFOREST to further defeat the privacy of the FL systems. Extensive experiments on 4 cyberattack datasets of different tasks demonstrate that FEDFOREST is effective, efficient, interpretable, and extendable. FEDFOREST ranks first in the collaborative learning and cybersecurity competition 2021 for Chinese college students.
研究动机与目标
- 解决现有基于学习的NIDS的局限性,特别是可解释性差、缺乏隐私保护以及难以应对未知攻击的问题。
- 通过联邦学习技术解决协作入侵检测中的数据隐私顾虑,确保原始网络数据保留在客户端本地。
- 通过用梯度提升决策树(GBDT)替代黑箱神经网络,提升模型的可解释性与可扩展性。
- 通过增量模型更新实现对未知攻击或零日攻击的检测,而无需从头开始重新训练。
- 集成先进的隐私增强技术,如差分隐私与机器遗忘,以防范数据重建攻击。
提出的方法
- 设计一种客户端-服务器联邦学习架构,每个客户端在其私有的网络流量数据上训练本地GBDT模型。
- 在服务器端使用类似FedAvg的聚合方法,聚合客户端模型更新,以训练全局GBDT分类器用于入侵检测。
- 通过向梯度中添加校准噪声,对模型更新应用差分隐私,确保$͔$-差分隐私,其中$͔ \in \{5, 10, 20, 50\}$。
- 实现一种受SISA启发的机器遗忘机制,允许通过仅重新训练受影响的服务器分类器,将客户端从模型中移除。
- 使用数据编码技术在传输前对客户端特征进行匿名化处理,增强对数据泄露攻击(如DLG)的抵抗能力。
- 通过在LightGBM和XGBoost配置上进行网格搜索,对超参数进行调优,以优化在多个数据集上的性能。
实验结果
研究问题
- RQ1基于GBDT的联邦学习框架能否在保护数据隐私的同时,实现多任务网络入侵检测的高准确率?
- RQ2差分隐私的集成对FedForest模型在不同网络攻击检测任务中的准确率与实用性有何影响?
- RQ3FedForest在多大程度上可通过增量学习检测并适应未知或零日攻击?
- RQ4所提出的机器遗忘机制在最小化重新训练成本的前提下,多大程度上能有效消除特定客户端对全局模型的影响?
- RQ5FedForest能否在不改变架构或模型结构的前提下,保持在多样化入侵检测任务中的可解释性与可扩展性?
主要发现
- FedForest在2021年中国大学生协同学习与网络安全竞赛中取得领先成绩,排名第一。
- 在四个多样化数据集——DDoS2019、DoHBrw2020、Darknet2020和MalDroid2020上,FedForest在所有任务中均实现了高准确率,展现出强大的泛化能力与可扩展性。
- 当$͔ = 5$时,FedForest在更强隐私保护下仍保持高准确率,其在实用性-隐私权衡方面优于非私有的基于DNN的NIDS。
- 随着$͔$值降低(隐私保护更强),模型准确率有所下降,但显著高于未启用差分隐私的基线DNN模型。
- 机器遗忘被高效支持:移除一个客户端仅需对剩余客户端重新训练服务器分类器,计算开销极小。
- FedForest成功识别已知攻击类型,并通过异常评分检测未知攻击,支持人工专家介入进行进一步分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。