Skip to main content
QUICK REVIEW

[论文解读] ThreatKG: An AI-Powered System for Automated Open-Source Cyber Threat Intelligence Gathering and Management

Peng Gao, Xiaoyuan Liu|arXiv (Cornell University)|Dec 20, 2022
Terrorism, Counterterrorism, and Political Violence被引用 9
一句话总结

ThreatKG 是一个基于人工智能的系统,通过分层本体论和深度学习技术,自动从非结构化的开源威胁情报(OSCTI)报告中收集、提取并结构化高保真度的网络威胁知识。它构建了一个可扩展、持续更新的威胁知识图谱,涵盖 IOCs、威胁行为者、战术、技术和过程(TTPs)以及语义关系,显著提升了传统仅基于 IOC 方法的威胁上下文感知能力。

ABSTRACT

Open-source cyber threat intelligence (OSCTI) has become essential for keeping up with the rapidly changing threat landscape. However, current OSCTI gathering and management solutions mainly focus on structured Indicators of Compromise (IOC) feeds, which are low-level and isolated, providing only a narrow view of potential threats. Meanwhile, the extensive and interconnected knowledge found in the unstructured text of numerous OSCTI reports (e.g., security articles, threat reports) available publicly is still largely underexplored. To bridge the gap, we propose ThreatKG, an automated system for OSCTI gathering and management. ThreatKG efficiently collects a large number of OSCTI reports from multiple sources, leverages specialized AI-based techniques to extract high-quality knowledge about various threat entities and their relationships, and constructs and continuously updates a threat knowledge graph by integrating new OSCTI data. ThreatKG features a modular and extensible design, allowing for the addition of components to accommodate diverse OSCTI report structures and knowledge types. Our extensive evaluations demonstrate ThreatKG's practical effectiveness in enhancing threat knowledge gathering and management.

研究动机与目标

  • 解决缺乏自动化系统从非结构化 OSCTI 报告中提取全面威胁知识的问题,这些报告包含丰富的上下文实体,如威胁行为者、TTPs 和 IOC 关系。
  • 克服由于报告格式多样、自然语言细微差别以及缺乏大规模标注训练语料而导致的高保真度威胁知识提取挑战。
  • 通过实时摄入新报告并更新知识库,实现威胁知识图谱的持续、可扩展且可扩展的构建。
  • 提供统一、结构化的威胁知识表示,支持高级威胁分析,并与现有 CTI 标准和平台集成。

提出的方法

  • 设计分层本体论,以建模多样化的威胁知识实体(如 IOCs、威胁行为者、TTPs)及其语义关系(如“发起”、“使用”)。
  • 实现基于深度学习的流水线,以从非结构化文本中准确提取实体和关系,包括对安全特定分词和句法细微差别的专门处理。
  • 构建可扩展、可扩展的系统架构,支持从多样化来源自动收集报告、提取知识、构建图谱、持久化存储以及增量更新。
  • 集成多种自然语言处理和机器学习技术,以应对格式多样性,并从 OSCTI 报告中过滤掉非威胁内容(如广告、推广信息)。
  • 支持将构建的威胁知识图谱转换为标准 CTI 格式(如 STIX 和 OpenIOC),以实现与现有平台的互操作性。
  • 通过图形用户界面(GUI)支持威胁分析师对知识图谱进行交互式探索,以查询和导航威胁关系。

实验结果

研究问题

  • RQ1如何从格式多样、语言复杂的非结构化 OSCTI 报告中,自动提取高保真度、多层次的威胁知识(超越 IOC)?
  • RQ2何种系统架构能够实现从流式 OSCTI 报告中大规模、持续且可扩展地构建和更新威胁知识图谱?
  • RQ3与现有仅关注 IOC 或单篇报告提取的方法相比,分层本体论与深度学习流水线在提升威胁知识提取的准确性和覆盖范围方面能达到何种程度?
  • RQ4与传统 IOC 信息源相比,所构建的威胁知识图谱在支持全面威胁场景重建和增强防御能力方面,其有效性如何?

主要发现

  • ThreatKG 能够以高保真度从多种 OSCTI 报告格式中成功提取广泛的威胁实体,包括 IOCs、威胁行为者、TTPs 和语义关系。
  • 该系统通过持续摄入并整合新的威胁报告,实现了可扩展性和可扩展性,构建了一个持续更新、持久存在的威胁知识图谱。
  • 评估结果表明,ThreatKG 在捕捉完整、多步骤威胁场景方面优于现有仅关注 IOC 的系统,通过关联知识实现更深入的威胁理解。
  • 所构建的威胁知识图谱通过建模攻击者的行为模式,使检测和响应更加稳健,对签名变化具有更强的鲁棒性。
  • 该系统能够将提取的知识转换为 STIX 等标准格式,实现与 AlienVault OTX、OpenCTI 等现有 CTI 平台的无缝集成。
  • 通过 GUI 支持的知识图谱交互探索,显著提升了分析师的工作效率,使其能够交互式查询和可视化复杂威胁关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。