Skip to main content
QUICK REVIEW

[论文解读] Automated Mapping of CVE Vulnerability Records to MITRE CWE Weaknesses

Ashraf Haddad, Najwa Aaraj|arXiv (Cornell University)|Apr 13, 2023
Network Security and Intrusion Detection被引用 5
一句话总结

本文提出了一种人机协同框架,用于使用自然语言处理(NLP)自动将CVE漏洞记录映射到MITRE CWE弱类型,同时发布了一个包含4,012条人工标注记录的新数据集。结果表明,微调后的SBERT和rankT5模型在语义相似性排序任务中显著优于BM25、BERT和RoBERTa,凸显了在漏洞分类任务中对深层上下文理解的必要性。

ABSTRACT

In recent years, a proliferation of cyber-security threats and diversity has been on the rise culminating in an increase in their reporting and analysis. To counter that, many non-profit organizations have emerged in this domain, such as MITRE and OSWAP, which have been actively tracking vulnerabilities, and publishing defense recommendations in standardized formats. As producing data in such formats manually is very time-consuming, there have been some proposals to automate the process. Unfortunately, a major obstacle to adopting supervised machine learning for this problem has been the lack of publicly available specialized datasets. Here, we aim to bridge this gap. In particular, we focus on mapping CVE records into MITRE CWE Weaknesses, and we release to the research community a manually annotated dataset of 4,012 records for this task. With a human-in-the-loop framework in mind, we approach the problem as a ranking task and aim to incorporate reinforced learning to make use of the human feedback in future work. Our experimental results using fine-tuned deep learning models, namely Sentence-BERT and rankT5, show sizable performance gains over BM25, BERT, and RoBERTa, which demonstrates the need for an architecture capable of good semantic understanding for this task.

研究动机与目标

  • 解决公开可用、面向特定任务的CVE记录到MITRE CWE弱类型的映射数据集匮乏的问题。
  • 开发一种自动化、基于人工智能的框架,支持人工分析人员使用标准化的CWE类型对漏洞进行标注。
  • 探索使用人类反馈强化学习(RLHF)以迭代方式提升漏洞分类任务中模型性能的潜力。
  • 评估最先进深度学习模型在网络安全文本语义相似性与排序任务中的有效性。
  • 发布可复现的开源数据集与标注流程,以支持未来自动化网络安全报告研究。

提出的方法

  • 将CVE到CWE的映射任务建模为排序问题,即对每个CVE描述在CWE条目集合中进行排序。
  • 对句子嵌入模型(SBERT)和rankT5模型进行微调,以提升CVE与CWE描述之间的语义相似性。
  • 以BM25作为基于词法匹配的基线检索模型。
  • 将BERT和RoBERTa作为语义相似性任务的基线模型进行评估,尽管其在排序任务中设计上并非最优。
  • 训练一个基于T5的序列到序列模型,直接从CVE描述生成CWE标签。
  • 实现人机协同反馈机制,为未来与人类反馈强化学习(RLHF)的集成提供支持。

实验结果

研究问题

  • RQ1深度学习模型是否能在将非结构化CVE记录映射到结构化MITRE CWE弱类型的任务中,超越传统检索方法(如BM25)?
  • RQ2在该语义排序任务中,基于Transformer的模型(如SBERT和rankT5)与通用模型(如BERT和RoBERTa)相比表现如何?
  • RQ3基于T5的序列到序列模型在多大程度上能直接从CVE描述中准确生成CWE标签?
  • RQ4所提出的“人机协同”框架在多大程度上能提升模型与专家标注决策的一致性?
  • RQ5在建模漏洞与弱类型描述之间的语义相似性时,模型架构的选择对性能有何影响?

主要发现

  • 微调后的SBERT在所有模型中表现最佳,显著优于BM25、BERT和RoBERTa,这得益于其针对句子相似性任务的专门设计。
  • rankT5模型也表现出色,表明专用排序架构在该任务中具有显著有效性。
  • 基于T5的序列到序列模型在生成的CWE标签上取得了0.51的宏平均F1分数,对常见漏洞(如跨站脚本攻击)的准确率高达0.96。
  • 对于此前未见过的7种CWE类型,模型生成了有意义但错误的标签,表明其具备生成能力,尽管在罕见标签上的F1得分为零。
  • 发布一个包含4,012条人工标注记录的数据集,填补了网络安全NLP研究中的关键空白,为未来基准测试与模型训练提供了支持。
  • 结果证实,语义理解对于该任务至关重要,因为仅依赖词法匹配(如BM25)无法实现准确映射。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。