Skip to main content
QUICK REVIEW

[论文解读] Outlier detection on network flow analysis

Quang-Vinh Dang|arXiv (Cornell University)|Aug 6, 2018
Anomaly Detection Techniques and Applications参考文献 1被引用 9
一句话总结

该论文评估了无监督异常检测算法在识别网络流量中DDoS攻击的效果,使用了具有类别不平衡标签的真实数据集。隔离森林(Isolation Forest)和基于PCA的方法表现优于其他方法,尤其在异常比例较低时,即使没有标注的训练数据,也能保持较高的AUC和准确率。

ABSTRACT

It is important to be able to detect and classify malicious network traffic flows such as DDoS attacks from benign flows. Normally the task is performed by using supervised classification algorithms. In this paper we analyze the usage of outlier detection algorithms for the network traffic classification problem.

研究动机与目标

  • 评估无监督异常检测算法在不依赖标注训练数据的情况下识别DDoS攻击的有效性。
  • 解决监督分类方法的局限性,特别是其对未见攻击类型泛化能力差以及对类别不平衡敏感的问题。
  • 在恶意流量与正常流量比例变化的情况下评估算法性能,尤其关注极端不平衡情况(如1:1000)。
  • 在包含76个特征的真实网络流数据上,对多种异常检测技术进行比较,并提供真实标签作为参考。
  • 识别在攻击流量比例较低时仍能保持高检测性能的算法。

提出的方法

  • 应用了七种无监督异常检测算法:CBLOF、HBOS、隔离森林(IForest)、k-NN、MCD、OCSVM和PCA。
  • 使用了一个包含464,976个样本和76个特征的真实网络流数据集,包括流持续时间、数据包数量以及数据包长度统计量等特征。
  • 通过自定义函数对正常流量和攻击流量进行子采样,构建了攻击比例从0.01%到99%的合成数据集,以控制类别分布。
  • 将每个数据集按70%训练集和30%测试集进行划分,确保任一特征在样本中均无恒定值。
  • 使用AUC和准确率分数评估性能,并在训练集和测试集之间进行比较,以评估泛化能力。
  • 报告了在不同正常流量比例下的结果,以模拟网络安全部署中常见的类别不平衡现实情况。

实验结果

研究问题

  • RQ1当数据集高度不平衡时,无监督异常检测算法在检测DDoS攻击方面的表现如何?
  • RQ2在不同攻击比例的网络流数据中,哪种异常检测算法在AUC和准确率上表现最佳?
  • RQ3异常检测算法在训练集和测试集上的性能表现如何,是否能体现其泛化能力?
  • RQ4异常检测方法是否能在训练阶段无需标注样本的情况下,检测出此前未见过的DDoS攻击模式?
  • RQ5恶意流量比例(攻击比例)如何影响不同异常检测算法的检测性能?

主要发现

  • 隔离森林(IForest)和基于PCA的异常检测在所有测试攻击比例下均取得了最高的AUC分数,尤其在正常流量比例增加时表现尤为突出。
  • 即使在极低的攻击比例下(如0.01%),IForest和PCA的AUC分数依然保持在较高水平,表明其在极端类别不平衡情况下的强大性能。
  • 所有算法的准确率分数均随正常流量比例的提高而上升,证实了类别不平衡对性能指标的影响。
  • 所有算法在训练集和测试集上的性能表现非常接近,表明无监督方法在不发生过拟合的情况下具有良好的泛化能力。
  • 数据集中攻击样本占比为3.76%(共17,462个攻击样本,总计464,976个样本),研究覆盖了从0.01%到99%的攻击比例,以模拟真实世界的应用场景。
  • 像IForest和PCA这样的异常检测方法在攻击发生率较低且攻击模式未知的情况下,优于传统监督分类器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。