[论文解读] DeepHunter: A Graph Neural Network Based Approach for Robust Cyber Threat Hunting
DeepHunter 是一种基于图神经网络(GNN)的鲁棒网络威胁狩猎方法,通过利用血缘图和已知攻击模式来建模攻击行为。它采用带有注意力机制的属性嵌入网络与图嵌入网络,即使在攻击步骤缺失或路径不连通的情况下,也能实现高精度与鲁棒性,相较于 Poirot 等最先进方法,在多个 APT 场景下的 AUC 得分表现更优。
Cyber Threat hunting is a proactive search for known attack behaviors in the organizational information system. It is an important component to mitigate advanced persistent threats (APTs). However, the attack behaviors recorded in provenance data may not be completely consistent with the known attack behaviors. In this paper, we propose DeepHunter, a graph neural network (GNN) based graph pattern matching approach that can match provenance data against known attack behaviors in a robust way. Specifically, we design a graph neural network architecture with two novel networks: attribute embedding networks that could incorporate Indicators of Compromise (IOCs) information, and graph embedding networks that could capture the relationships between IOCs. To evaluate DeepHunter, we choose five real and synthetic APT attack scenarios. Results show that DeepHunter can hunt all attack behaviors, and the accuracy and robustness of DeepHunter outperform the state-of-the-art method, Poirot.
研究动机与目标
- 解决现有威胁狩猎工具依赖刚性规则匹配且对血缘数据不一致性敏感的局限性。
- 通过从系统事件中端到端学习图模式,减少对专家的依赖。
- 提升对现实世界不一致性(如缺失攻击步骤、噪声数据和不连通攻击路径)的鲁棒性。
- 开发一种图模式匹配系统,即使查询图与血缘图在结构或完整性上存在差异,也能保持高精度。
提出的方法
- 提出一种双分支 GNN 架构:使用注意力机制加权不同 IOCs 属性(如文件名、IP 地址、端口)重要性的属性嵌入网络。
- 采用独立的图嵌入网络(使用 GCN 和一种自定义 GNN)来编码血缘图与查询图中的结构关系。
- 使用类似 Siamese 的相似性学习框架,结合 NTN(双线性)层,计算两图图级嵌入之间的匹配分数。
- 引入一种新型损失函数,促使模型对匹配图对分配高分,对非匹配图对分配低分,从而实现端到端训练。
- 利用血缘图捕捉长期攻击上下文,实现对复杂多阶段 APT 的检测。
- 设计模型以应对血缘图中节点或边缺失的问题,通过关注结构与属性一致性,而非完全的路径连通性。
实验结果
研究问题
- RQ1当攻击步骤缺失或路径不连通时,基于 GNN 的方法是否能在检测 APT 时表现出比基于规则或基于路径的图匹配更高的鲁棒性?
- RQ2所提出的带注意力机制的属性嵌入网络在捕捉不同 IOCs 属性对威胁检测的相关性方面效果如何?
- RQ3在部分或噪声数据下,图嵌入网络在保留血缘图与查询图之间结构相似性方面的能力如何?
- RQ4在多种 APT 场景下,DeepHunter 与 Poirot 等最先进方法及其他 GNN 模型相比,在 AUC 和鲁棒性方面表现如何?
主要发现
- DeepHunter 在 CADETS 数据集上 AUC 达到 1.0,在 TRACE 上为 0.951,在 ETW 上为 0.916,显著优于 Poirot 和其他 GNN 基线模型。
- 即使攻击路径不连通,模型依然有效——而 Poirot 因缺失路径的零影响分值而失效。
- 移除属性嵌入网络(DeepHunter-wo-AEN)后,AUC 降至 0.891(TRACE)和 0.820(ETW),证明注意力机制属性编码器的必要性。
- DeepHunter 在所有数据集上均优于 MatchGNet、MatchGNet-NTN、SimGNN 和 GMN,在三个测试集上均取得最高 AUC。
- 非学习基线方法 Weisfeiler-Lehman 核的性能较差(TRACE 上 AUC 为 0.492,ETW 上为 0.301),凸显了基于学习的相似性建模的必要性。
- DeepHunter 成功检测出全部五个真实与合成的 APT 场景,证明其在复杂威胁狩猎环境中的鲁棒性与实际适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。