Skip to main content
QUICK REVIEW

[论文解读] Common Vulnerability Scoring System Prediction based on Open Source Intelligence Information Sources

Philipp Kuehn, David N. Relke|arXiv (Cornell University)|Oct 5, 2022
Web Application Security Vulnerabilities被引用 4
一句话总结

本文提出一种深度学习方法,利用传统漏洞数据库(如NVD)之外的开源情报(OSINT)文本预测通用漏洞评分系统(CVSS)向量。通过网络爬取并分析NVD条目中引用的网页(如博客、新闻文章和补丁说明),该研究在NVD描述与OSINT文本的组合数据上训练基于DistilBERT的模型,在CVSS组件预测任务中实现了最先进性能,尽管仅使用OSINT数据时并未带来显著性能提升。

ABSTRACT

The number of newly published vulnerabilities is constantly increasing. Until now, the information available when a new vulnerability is published is manually assessed by experts using a Common Vulnerability Scoring System (CVSS) vector and score. This assessment is time consuming and requires expertise. Various works already try to predict CVSS vectors or scores using machine learning based on the textual descriptions of the vulnerability to enable faster assessment. However, for this purpose, previous works only use the texts available in databases such as National Vulnerability Database. With this work, the publicly available web pages referenced in the National Vulnerability Database are analyzed and made available as sources of texts through web scraping. A Deep Learning based method for predicting the CVSS vector is implemented and evaluated. The present work provides a classification of the National Vulnerability Database's reference texts based on the suitability and crawlability of their texts. While we identified the overall influence of the additional texts is negligible, we outperformed the state-of-the-art with our Deep Learning prediction models.

研究动机与目标

  • 探究除漏洞数据库外的公开网络资源是否能提升CVSS向量预测性能。
  • 识别并分类报告漏洞的OSINT来源(如博客、新闻、GitHub等)。
  • 构建并评估一种结合NVD描述与爬取的OSINT文本的深度学习模型,用于CVSS预测。
  • 评估使用OSINT作为训练数据进行自动化漏洞严重性评分的可行性与质量。
  • 基于标准化指标,将所提模型的性能与现有最先进方法进行比较。

提出的方法

  • 对NVD条目中引用的URL应用网络爬取,提取博客、新闻网站和GitHub等域名的文本内容。
  • 对爬取来源的文本进行过滤、清洗,并与官方NVD漏洞描述合并用于模型训练。
  • 采用微调后的DistilBERT模型作为核心深度学习架构,用于CVSS向量组件的多标签分类。
  • 使用均方误差(MSE)和平均绝对误差(MAE)等指标,在多个测试集上对模型进行训练与评估。
  • 通过比较仅使用NVD数据与包含OSINT文本数据的模型,评估OSINT数据的影响。
  • 与先前工作进行了对比评估,但受限于模型可用性与指标一致性,完整可复现性受到阻碍。

实验结果

研究问题

  • RQ1在传统漏洞数据库之外,漏洞相关文本信息可从何处获取(RQ1)?
  • RQ2除漏洞数据库外的公开数据源在多大程度上适用于CVSS向量预测(RQ2)?
  • RQ3与仅使用NVD数据训练的模型相比,基于OSINT文本的模型能否提升CVSS向量预测的准确性?
  • RQ4哪些类型的OSINT来源在收集漏洞相关文本数据方面最具可靠性与可爬取性?
  • RQ5不同深度学习模型在预测CVSS向量各分量及整体严重性评分方面的表现如何?

主要发现

  • 本研究成功从NVD条目中识别并分类出11,738个唯一URL,基于内容与可用性将其划分为12个不同类别。
  • 尽管进行了广泛的爬取与OSINT文本整合,但额外数据并未在模型性能上带来统计显著的提升。
  • 基于DistilBERT的模型在仅使用NVD描述的情况下,于Desc2022测试集上实现了最先进性能,平均绝对误差(MAE)为0.203。
  • 在NVD与OSINT数据联合训练的模型中,MAE为0.248,未优于仅使用NVD数据的基线模型,表明在此设置下OSINT未带来明确优势。
  • 结果表明,尽管OSINT来源可用于训练,但其噪声大且不一致的特性可能限制其对模型准确率的提升作用。
  • 本研究强调了改进文本过滤方法与开展领域特定预训练的必要性,以充分发挥OSINT在CVSS预测中的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。