[论文解读] A Framework for Unsupervised Classificiation and Data Mining of Tweets about Cyber Vulnerabilities
本文提出了一种无监督框架,利用零样本BART分类对网络漏洞推文进行分类与挖掘,无需标注数据即可实现83.52%的准确率。研究表明,每个CVE的推文数量可揭示传统风险评分忽略的高影响、低CVSS漏洞,从而实现对基于NVD工具的实时威胁情报增强。
Many cyber network defense tools rely on the National Vulnerability Database (NVD) to provide timely information on known vulnerabilities that exist within systems on a given network. However, recent studies have indicated that the NVD is not always up to date, with known vulnerabilities being discussed publicly on social media platforms, like Twitter and Reddit, months before they are published to the NVD. To that end, we present a framework for unsupervised classification to filter tweets for relevance to cyber security. We consider and evaluate two unsupervised machine learning techniques for inclusion in our framework, and show that zero-shot classification using a Bidirectional and Auto-Regressive Transformers (BART) model outperforms the other technique with 83.52% accuracy and a F1 score of 83.88, allowing for accurate filtering of tweets without human intervention or labelled data for training. Additionally, we discuss different insights that can be derived from these cyber-relevant tweets, such as trending topics of tweets and the counts of Twitter mentions for Common Vulnerabilities and Exposures (CVEs), that can be used in an alert or report to augment current NVD-based risk assessment tools.
研究动机与目标
- 为解决国家漏洞数据库(NVD)在漏洞披露方面滞后于Twitter等社交媒体上公开讨论的问题。
- 开发一种无监督方法,无需标注训练数据或模型微调,即可过滤网络相关推文。
- 从网络相关推文中提取可操作的洞察,如趋势话题和CVE提及频率,以提升实时态势感知能力。
- 证明推文计数指标可优先识别CVSS3评分较低但公众利用兴趣高的漏洞。
- 通过将实时社交媒体情报(OSINT)整合到实际网络防御工作流中,扩展当前风险评估工具。
提出的方法
- 采用微调后的BART语言模型进行零样本分类,无需标注数据即可判断推文是否与网络安全相关。
- 将BART零样本方法与基于TF-IDF和余弦相似度的传统无监督方法在相关性过滤方面进行对比。
- 从Twitter收集并整理了包含术语“vulnerability”的推文数据集,不依赖CVE ID进行包含。
- 使用命名实体识别从相关推文中提取CVE提及,并将其链接至已知漏洞记录。
- 计算随时间推移每个CVE的推文数量,以衡量公众关注程度和潜在可利用性。
- 分析推文数量与CVSS3评分之间的相关性,以评估社交媒体讨论的预测价值。
实验结果
研究问题
- RQ1使用类似BART的预训练语言模型进行零样本分类,能否在无需任何标注训练数据的情况下准确识别网络相关推文?
- RQ2零样本BART在过滤网络漏洞推文方面的性能与传统无监督方法(如TF-IDF)相比如何?
- RQ3每个CVE的推文数量在多大程度上可作为可利用性或公众威胁关注程度的代理指标,特别是针对低CVSS3评分的漏洞?
- RQ4社交媒体数据能否揭示被基于NVD的风险评分系统(如CVSS3)所忽略的高影响漏洞?
- RQ5实时挖掘网络相关推文如何增强态势感知能力,并支持实际网络防御工具?
主要发现
- 零样本BART分类器在识别网络相关推文方面实现了83.52%的准确率和83.88的F1分数,优于TF-IDF基线方法。
- BART模型在无需任何标注数据或模型微调的情况下成功过滤了相关推文,实现了可扩展的部署。
- 推文数量与CVSS3评分之间的相关系数为0.04,表明两者无显著关系——说明推文数量捕捉了与CVSS3不同的威胁信号。
- CVE-2019-15126(KR00K)的CVSS3评分为3.1(较低),但却是第五大被提及的CVE,凸显其在公众中的广泛讨论和实际利用。
- 推文计数指标成功识别出高影响、已被公开利用的漏洞,而这些漏洞在基于CVSS3的风险模型中会被优先级下调。
- 该框架通过在NVD发布前或同时检测社交媒体上的新兴威胁,实现了实时态势感知。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。