Skip to main content
QUICK REVIEW

[论文解读] EXTRACTOR: Extracting Attack Behavior from Threat Reports

Kiavash Satvat, Rigel Gjomemo|arXiv (Cornell University)|Apr 17, 2021
Advanced Malware Detection Techniques参考文献 55被引用 7
一句话总结

Extractor 是一种基于自然语言处理(NLP)的新工具,通过构建表示系统级操作、实体及因果依赖关系的溯源图,自动从非结构化的网络威胁情报(CTI)报告中提取简洁、可操作的攻击行为。该方法结合文本摘要、句法转换和语义角色标注(SRL),有效克服了文本冗长、结构复杂及关系抽取困难等挑战,实现了高保真度的图结构提取。该结果经专家标注报告验证,可直接用于威胁狩猎工作流。

ABSTRACT

The knowledge on attacks contained in Cyber Threat Intelligence (CTI) reports is very important to effectively identify and quickly respond to cyber threats. However, this knowledge is often embedded in large amounts of text, and therefore difficult to use effectively. To address this challenge, we propose a novel approach and tool called EXTRACTOR that allows precise automatic extraction of concise attack behaviors from CTI reports. EXTRACTOR makes no strong assumptions about the text and is capable of extracting attack behaviors as provenance graphs from unstructured text. We evaluate EXTRACTOR using real-world incident reports from various sources as well as reports of DARPA adversarial engagements that involve several attack campaigns on various OS platforms of Windows, Linux, and FreeBSD. Our evaluation results show that EXTRACTOR can extract concise provenance graphs from CTI reports and show that these graphs can successfully be used by cyber-analytics tools in threat-hunting.

研究动机与目标

  • 解决从冗长、非结构化的 CTI 报告中提取全面、结构化攻击行为的挑战。
  • 克服以往研究仅关注孤立 IOCs 或威胁行为,而未捕捉因果关系、时间顺序或信息流关系的局限性。
  • 以机器可读的溯源图形式生成可直接用于威胁检测与分析的可操作情报。
  • 实现对来自多种来源(包括真实世界和 DARPA 攻击对抗活动报告)的大规模 CTI 报告、博客和事件报告的可扩展处理。
  • 实现对攻击行为的自动化、精确且语义丰富的提取,准确反映自然语言中“谁对谁做了什么、何时何地”的叙事逻辑。

提出的方法

  • 提出一种新颖的文本摘要技术,从无关内容中隔离出与攻击相关的信息,减少冗余,聚焦于行为描述。
  • 采用句法与语义转换技术,将复杂、领域特定且标点不规范的 CTI 文本转化为更易消费的形式。
  • 应用语义角色标注(SRL)识别句子中的主语、谓语和宾语角色,从而推断出“谁对谁做了什么”以及时间与空间上下文。
  • 构建溯源图,其中节点表示系统实体(如文件、进程、注册表项、套接字),边表示系统调用等操作,并体现因果与时间依赖关系。
  • 将 SRL 输出整合到图数据结构中,以建模攻击步骤、攻击载荷及信息流,支持下游分析。
  • 通过真实世界事件报告和 DARPA 攻击对抗活动报告构建评估流程,验证图结构的准确性与在威胁狩猎中的实用性。

实验结果

研究问题

  • RQ1系统能否在不依赖预定义模板或语法规则的前提下,自动从非结构化 CTI 报告中提取精确、可操作的攻击行为?
  • RQ2结合文本摘要、句法转换与 SRL 的方法,在复杂 CTI 报告中提取系统实体与操作之间因果关系和时间关系的效率如何?
  • RQ3所提取的溯源图在结构与完整性方面与专家构建的图相比,匹配程度如何?
  • RQ4所提取的图能否被网络安全分析工具有效用于威胁狩猎与检测?
  • RQ5该系统在处理多样化的 CTI 报告来源(包括语言复杂度高、技术术语多的报告)时,扩展能力如何?

主要发现

  • Extractor 能够从 CTI 报告中成功提取出与安全专家手动构建的图高度一致的溯源图,展现出极高的结构保真度。
  • 通过过滤地理来源、背景信息等无关内容,系统在识别攻击相关文本方面实现了高精度。
  • SRL 的应用使得即使在复杂且结构不良的报告中,也能准确推断出“谁对谁做了什么”以及操作的时间顺序。
  • Extractor 提取的溯源图可直接被威胁狩猎与检测工具使用,因其准确建模了审计日志中可观测到的系统级行为。
  • 在真实世界报告与 DARPA 攻击对抗活动报告上的评估结果证实,系统在多种平台(Windows、Linux、FreeBSD)和报告类型中均表现出强健性。
  • 该方法可有效扩展至大规模 CTI 报告处理,实现对公开来源的海量报告进行自动化知识提取。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。