[论文解读] Automating Cyber Threat Hunting Using NLP, Automated Query Generation, and Genetic Perturbation
本文提出 WILEE,一种由人工智能驱动的系统,通过自然语言处理(Malmo)将人类可读的威胁描述自动提取并转换为机器可执行的领域特定语言(DSL)查询,并利用遗传编程(GPE)生成指标的新型扰动变体(IOCs)。该系统通过自动化DSL生成和IOC变异,显著减少对人工领域专家输入的依赖,同时扩展检测覆盖范围,实现对已知和持续演化的威胁的可扩展、自适应检测。
Scaling the cyber hunt problem poses several key technical challenges. Detecting and characterizing cyber threats at scale in large enterprise networks is hard because of the vast quantity and complexity of the data that must be analyzed as adversaries deploy varied and evolving tactics to accomplish their goals. There is a great need to automate all aspects, and, indeed, the workflow of cyber hunting. AI offers many ways to support this. We have developed the WILEE system that automates cyber threat hunting by translating high-level threat descriptions into many possible concrete implementations. Both the (high-level) abstract and (low-level) concrete implementations are represented using a custom domain specific language (DSL). WILEE uses the implementations along with other logic, also written in the DSL, to automatically generate queries to confirm (or refute) any hypotheses tied to the potential adversarial workflows represented at various layers of abstraction.
研究动机与目标
- 将人类可读的威胁描述自动翻译为可用于网络威胁狩猎的可执行、机器可处理的查询。
- 减少在 WILEE 框架中创建和维护基于TTP的检测规则时对领域专家(SME)的人工依赖。
- 通过遗传扰动技术对已知威胁的IOCs进行变异,生成新颖且行为上合理的变体,从而扩展检测覆盖范围。
- 通过动态演化威胁模型以响应对手战术的演变,实现可扩展、自适应的威胁狩猎。
- 评估AI生成的DSL与扰动IOCs在已知威胁模拟(如CALDERA和OpTC)中的有效性。
提出的方法
- Malmo 使用自然语言处理技术,从半结构化的、人类可读的文档中提取关键威胁元素(如战术、技术、程序(TTPs)和IOCs),并将其转换为适用于机器处理的Python风格DSL。
- 该系统采用基于MITRE ATT&CK并扩展CybOX的自定义领域特定语言(DSL),用于建模网络和主机实体,包括那些CybOX原生不支持的实体。
- 遗传扰动引擎(GPE)应用基于语法引导的遗传编程,通过从经过筛选的IOCs数据库中使用类型匹配的替代值,对威胁实现进行变异。
- GPE 使用新颖性搜索,并在多样性与适应度之间采用可调平衡,以在初始适应度值未知或动态变化时探索新的威胁变体。
- 系统通过数据代理与数据存储集成,自动生成功能查询并在企业网络数据中检测TTP序列。
- 扰动在DSL代码的抽象语法树(AST)层级上应用,确保安全、语法正确的变异,同时保留执行语义并探索新的攻击面变体。
实验结果
研究问题
- RQ1自然语言处理技术能否有效从人类可读的威胁描述中提取并转换为可执行、机器可处理的DSL查询,以实现自动化威胁狩猎?
- RQ2遗传编程在多大程度上能够生成有意义且行为上合理的已知IOCs变体,以检测演化的或未知的威胁?
- RQ3AI生成的DSL与扰动IOCs在检测模拟攻击时,其性能与人工编写的SME生成规则相比如何?
- RQ4当适应度信号延迟或不稳定时,采用自适应平衡的新颖性搜索能否有效提升对未知威胁变体的探索能力?
- RQ5利用学习到的攻击者行为来指导新IOCs的生成,并扩展检测家族,其潜力如何?
主要发现
- Malmo 成功从半结构化的文档中提取并转换关键威胁元素(包括IOCs和TTPs)为可执行的DSL,实现了自动化查询生成。
- GPE 组件通过使用类型感知、基于数据库的替换机制,生成语法正确且多样化的威胁实现变体。
- 采用可调多样性与适应度平衡的新颖性搜索,即使在初始适应度值未知或不稳定的情况下,也能有效探索威胁空间。
- 系统在使用AI生成的DSL检测已知威胁方面表现出可行性,初步评估显示与CALDERA和OpTC模拟中的真实情况一致。
- 该框架通过生成反映合理攻击者演化的新型IOCs,实现了动态、自适应的威胁狩猎,例如在C2C域名中用合理替代品替换已知软件作者。
- 未来工作表明,GPE可进一步增强以生成类似正则表达式的模式,用于检测整个相关威胁家族,从而提升检测覆盖范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。