Skip to main content
QUICK REVIEW

[论文解读] Analyzing the Perceived Severity of Cybersecurity Threats Reported on Social Media

Shi Zong, Alan Ritter|arXiv (Cornell University)|Feb 27, 2019
Spam and Phishing Detection参考文献 24被引用 8
一句话总结

本文提出一种自然语言处理方法,通过人工标注的6,000条社交媒体推文语料,自动分类网络攻击威胁的感知严重性。该方法在预测高严重性漏洞时达到0.86的Precision@50,显著优于基于推文数量的基线模型,并表明在线用户意见可预测真实世界的利用情况。

ABSTRACT

Breaking cybersecurity events are shared across a range of websites, including security blogs (FireEye, Kaspersky, etc.), in addition to social media platforms such as Facebook and Twitter. In this paper, we investigate methods to analyze the severity of cybersecurity threats based on the language that is used to describe them online. A corpus of 6,000 tweets describing software vulnerabilities is annotated with authors' opinions toward their severity. We show that our corpus supports the development of automatic classifiers with high precision for this task. Furthermore, we demonstrate the value of analyzing users' opinions about the severity of threats reported online as an early indicator of important software vulnerabilities. We present a simple, yet effective method for linking software vulnerabilities reported in tweets to Common Vulnerabilities and Exposures (CVEs) in the National Vulnerability Database (NVD). Using our predicted severity scores, we show that it is possible to achieve a Precision@50 of 0.86 when forecasting high severity vulnerabilities, significantly outperforming a baseline that is based on tweet volume. Finally we show how reports of severe vulnerabilities online are predictive of real-world exploits.

研究动机与目标

  • 探究自然语言处理是否能有效分析社交媒体上用户报告的网络安全威胁的感知严重性。
  • 基于推文内容中的语言线索,开发一种高精度的自动分类器,用于识别严重漏洞。
  • 通过基于URL的CVE提取方法,将讨论软件漏洞的推文与国家漏洞数据库(NVD)中的官方CVE条目关联。
  • 评估在线用户对威胁严重性的感知是否与专家发布的CVSS评分以及真实世界的利用活动相关。
  • 识别历史上表现可靠的Twitter账号,以定量评估其在严重漏洞预警方面的可信度。

提出的方法

  • 采用两阶段共识标注流程(每条推文由5名和10名标注员参与),对6,000条描述软件漏洞的推文进行感知严重性标注。
  • 在标注语料上训练有监督的文本分类模型,基于推文内容的语言特征预测感知严重性。
  • 开发一种方法,通过从推文中提取的URL中识别CVE标识符,将推文映射到NVD中的CVE条目。
  • 使用严重性分类器按感知严重性对漏洞进行排序,并与官方CVSS评分及真实世界利用数据对比评估性能。
  • 采用top-k排名(如top 50)的精确率与召回率指标,评估其相对于基于推文数量的基线模型的预测性能。
  • 通过对比真实CVSS评分与利用数据,评估各账号的预测表现,识别高精度的Twitter账号。

实验结果

研究问题

  • RQ1自然语言处理技术能否准确分类社交媒体帖子中表达的网络安全威胁感知严重性?
  • RQ2用户在线对威胁严重性的意见与NVD中的官方CVSS评分在多大程度上一致?
  • RQ3社交媒体内容中的感知严重性能否作为漏洞在真实世界中被利用的早期指标?
  • RQ4基于语言内容的严重性分类器与仅依赖推文数量的基线模型相比,在预测高严重性威胁方面表现如何?
  • RQ5哪些Twitter账号能持续发出关于严重漏洞的可靠预警,其可信度能否被定量评估?

主要发现

  • 所提出的模型在预测高严重性漏洞时达到0.86的Precision@50,显著优于基于推文数量的基线模型。
  • 模型预测的前10个严重漏洞中,有7个后来被证实已在真实世界中被利用,而按实际CVSS评分排名的前10个中仅1个被利用。
  • 模型的严重性预测与真实世界利用活动高度相关,相关性通过Symantec病毒签名和Exploit-DB条目进行衡量。
  • @securityaffairs、@EduardKovacs和@jburnsconsult等账号在预测严重威胁时达到100%准确率,表明其高度可靠。
  • 包含6,000条带严重性标签的标注语料,为开发高精度威胁严重性感知自动分类器提供了支持。
  • 通过URL提取标识符将推文与NVD CVE条目关联的方法,在大规模分析中被证明有效且可扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。