Skip to main content
QUICK REVIEW

[论文解读] Forecasting Cyber Attacks with Imbalanced Data Sets and Different Time Granularities

Ahmet Okutan, Shanchieh Jay Yang|arXiv (Cornell University)|Mar 26, 2018
Network Security and Intrusion Detection参考文献 18被引用 13
一句话总结

该论文提出了一种基于贝叶斯网络的框架,利用来自Twitter和GDELT的非传统信号,以不同时间粒度($t_x$用于信号,$t_g$用于真实事件)预测匿名组织的网络攻击。该框架引入了SMOTE++这一新型混合过采样技术,显著提升了AUC性能——在高度不平衡的网络威胁数据集上,对恶意软件、篡改、拒绝服务(DOS)以及恶意电子邮件/URL攻击的AUC最高可达70%。

ABSTRACT

If cyber incidents are predicted a reasonable amount of time before they occur, defensive actions to prevent their destructive effects could be planned. Unfortunately, most of the time we do not have enough observables of the malicious activities before they are already under way. Therefore, this work suggests to use unconventional signals extracted from various data sources with different time granularities to predict cyber incidents for target entities. A Bayesian network is used to predict cyber attacks where the unconventional signals are used as indicative random variables. This work also develops a novel minority class over sampling technique to improve cyber attack prediction on imbalanced data sets. The results show that depending on the selected time granularity, the unconventional signals are able to predict cyber attacks for the anonimyzed target organization even though the signals are not explicitly related to that organization. Furthermore, the minority over sampling approach developed achieves better performance compared to the existing filtering techniques in the literature.

研究动机与目标

  • 通过间接的、非传统的信号而非直接的网络可观测数据,主动预测网络攻击。
  • 研究不同时间粒度($t_x$用于信号,$t_g$用于真实事件)对预测性能的影响。
  • 通过提升少数类预测能力,应对网络威胁数据集高度不平衡的挑战。
  • 开发并评估一种新型过采样技术SMOTE++,该技术结合了欠采样、合成少数类样本生成以及实例重加权,以提升模型泛化能力。

提出的方法

  • 从Twitter和GDELT中提取非传统信号,二者可实时监测全球媒体和社交媒体言论。
  • 在不同时间窗口$ t_x $(例如1天、3天、1周)内聚合信号,以捕捉时间趋势。
  • 在时间窗口$ t_g $(例如12、24、48小时)内为目标实体定义真实事件,以构建带标签的训练集和测试集。
  • 应用贝叶斯网络,对非传统信号与网络攻击结果之间的概率依赖关系进行建模。
  • 开发SMOTE++作为混合过采样方法,整合多数类的欠采样、少数类的合成样本生成以及实例重加权。
  • 通过AUC和F1-score在多种攻击类型及时间粒度组合下评估模型性能。

实验结果

研究问题

  • RQ1即使与目标组织无直接关联,社交媒体和全球新闻源中的非传统信号是否仍能预测该组织的网络攻击?
  • RQ2不同的时间粒度($t_x$用于信号,$t_g$用于真实事件)如何影响网络攻击预测模型的预测性能?
  • RQ3与现有过滤方法相比,所提出的SMOTE++过采样技术是否能提升在高度不平衡网络威胁数据集上的预测性能?
  • RQ4哪些非传统信号(例如GEM、GET、GEA)对特定类型的网络攻击最具指示性?
  • RQ5SMOTE++带来的性能提升在不同攻击类型和时间粒度设置下是否具有统计显著性?

主要发现

  • 仅使用来自Twitter和GDELT的非传统信号,贝叶斯网络模型在预测恶意软件、篡改、拒绝服务(DOS)以及恶意电子邮件/URL攻击时,AUC最高可达70%。
  • 在所有攻击类型中,GEM、GET和GEA信号始终比其他信号更具指示性。
  • SMOTE++在所有攻击类型上的AUC表现均优于SMOTE和RandomSubsample,在$ t_g = 12 $或$ 48 $小时时具有统计显著的提升。
  • 最佳时间粒度($ t_x $和$ t_g $)因攻击类型而异,较短的$ t_g $值(12–24小时)对频繁攻击的预测性能更优。
  • 对同一信号使用不同的$ t_x $值可提升模型性能,表明信号聚合窗口的选择对预测能力至关重要。
  • 即使在高度不平衡的数据集上,该模型仍保持强劲性能,表明SMOTE++技术能有效缓解类别偏移问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。