Skip to main content
QUICK REVIEW

[论文解读] That Escalated Quickly: An ML Framework for Alert Prioritization

Ben Gelman, Salma Taoufiq|arXiv (Cornell University)|Feb 13, 2023
Anomaly Detection Techniques and Applications被引用 5
一句话总结

本文提出 TEQ,一种机器学习框架,通过使用自动化特征提取、集成学习和分析师反馈整合,预测警报和事件的可操作性,从而减少托管安全运营中心中的警报疲劳。该框架在真实部署中实现了可操作事件响应时间减少22.9%,抑制了54%的误报,检测率达到95.1%,并将每位事件的分析师调查工作量减少了14%。

ABSTRACT

In place of in-house solutions, organizations are increasingly moving towards managed services for cyber defense. Security Operations Centers are specialized cybersecurity units responsible for the defense of an organization, but the large-scale centralization of threat detection is causing SOCs to endure an overwhelming amount of false positive alerts -- a phenomenon known as alert fatigue. Large collections of imprecise sensors, an inability to adapt to known false positives, evolution of the threat landscape, and inefficient use of analyst time all contribute to the alert fatigue problem. To combat these issues, we present That Escalated Quickly (TEQ), a machine learning framework that reduces alert fatigue with minimal changes to SOC workflows by predicting alert-level and incident-level actionability. On real-world data, the system is able to reduce the time it takes to respond to actionable incidents by $22.9\%$, suppress $54\%$ of false positives with a $95.1\%$ detection rate, and reduce the number of alerts an analyst needs to investigate within singular incidents by $14\%$.

研究动机与目标

  • 解决由于大量误报和重复警报导致的集中式托管安全运营中心(SOC)中警报疲劳的问题。
  • 在不干扰现有 SOC 工作流的前提下,提升警报优先级排序和事件响应效率。
  • 通过从分析师反馈中实现自适应学习,无需硬编码规则,支持不断演变的威胁环境。
  • 通过利用异构、半结构化的传感器数据,在多样化客户环境中实现可扩展性。
  • 通过自动化警报级别和事件级别的评分,减少分析师工作量。

提出的方法

  • TEQ 使用自动特征工程管道,解析并验证半结构化的传感器数据,包括处理缺失值和数据不一致性。
  • 时间计算模块分析跨客户和终端的历史警报模式,将上下文信息丰富到特征向量中。
  • 训练并集成两个独立的机器学习模型,以在警报级别和事件级别生成综合风险评分。
  • 分类模块利用这些评分对事件进行优先级排序,抑制误报,并对事件内的警报进行重排序,以加快分析速度。
  • 非侵入式反馈回路捕获分析师的解决结果,并通过管道重新处理数据,逐步提升模型性能。
  • 系统在分析师 GUI 中支持双重视角的警报排序——按时间顺序排列以提供上下文,按 TEQ 评分排列以实现快速可操作性。

实验结果

研究问题

  • RQ1在不破坏现有分析师工作流的前提下,机器学习框架能否减少托管 SOC 环境中的警报疲劳?
  • RQ2从异构、半结构化的传感器数据中进行自动化特征提取,在多大程度上能提升警报优先级排序的准确性?
  • RQ3无须手动规则工程,基于反馈的系统在多大程度上能适应新威胁和已知误报?
  • RQ4警报级别和事件级别的评分对减少分析师调查时间和误报数量有何影响?
  • RQ5在长期实际部署中,系统能否在抑制大量误报的同时保持高检测率?

主要发现

  • 在真实部署中,TEQ 将可操作事件的平均响应时间减少了22.9%。
  • 在为期一个月的测试期内,系统抑制了54%的误报,同时对可操作事件的检测率保持在95.1%。
  • 基于 TEQ 评分的事件内警报优先级排序,平均使分析师需要调查的警报数量减少了14%。
  • 该框架在关键特征和模型类型随时间变化的情况下表现出鲁棒性,表明具备长期可靠性。
  • 反馈回路实现了对新威胁和误报的持续适应,无需显式更新规则。
  • 跨客户整合上下文特征提升了模型的泛化能力,尤其在多样化、大规模的 MDR 部署中表现显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。