Skip to main content
QUICK REVIEW

[论文解读] Leveraging Uncertainty for Improved Static Malware Detection Under Extreme False Positive Constraints

André T. Nguyen, Edward Raff|arXiv (Cornell University)|Aug 9, 2021
Advanced Malware Detection Techniques参考文献 43被引用 9
一句话总结

本文提出通过集成与贝叶斯方法估算模型不确定性,以在极端低误报率(FPR)约束下提升静态恶意软件检测性能,在Sophos数据集上实现1e-5 FPR下的0.80真正例率(TPR),相较先前方法相对提升16%。研究提出了一套修正后的评估协议,并证明不确定性估计有助于识别模型错误与新型恶意软件家族。

ABSTRACT

The detection of malware is a critical task for the protection of computing environments. This task often requires extremely low false positive rates (FPR) of 0.01% or even lower, for which modern machine learning has no readily available tools. We introduce the first broad investigation of the use of uncertainty for malware detection across multiple datasets, models, and feature types. We show how ensembling and Bayesian treatments of machine learning methods for static malware detection allow for improved identification of model errors, uncovering of new malware families, and predictive performance under extreme false positive constraints. In particular, we improve the true positive rate (TPR) at an actual realized FPR of 1e-5 from an expected 0.69 for previous methods to 0.80 on the best performing model class on the Sophos industry scale dataset. We additionally demonstrate how previous works have used an evaluation protocol that can lead to misleading results.

研究动机与目标

  • 解决生产环境中实现极低误报率(≤0.01%)的严峻挑战,当前机器学习方法缺乏有效工具应对此问题。
  • 识别并修正先前评估协议中的普遍缺陷:通过在测试集上选择阈值而非验证集,错误估算TPR@FPR。
  • 通过利用不确定性估计动态调整决策阈值,在极端FPR约束下提升模型性能。
  • 通过利用认知不确定性与随机不确定性作为分布外样本的指示器,实现对新型恶意软件家族的更早检测。

提出的方法

  • 应用集成与贝叶斯神经网络技术(如蒙特卡洛 dropout)对每个恶意软件样本估计认知不确定性(模型)与随机不确定性(数据)。
  • 使用独立的验证集确定目标FPR下的最优分类阈值,而非从测试集中选择,以避免数据泄露并获得真实的FPR估计。
  • 提出基于不确定性评分的局部阈值调整策略,对不确定性更高的样本实施更严格的评估,以在保持低FPR的同时提升TPR。
  • 在公开数据集(EMBER2018、Sophos)上训练并评估多种模型(如LightGBM、MalConv、FFNN),采用不确定性感知的推理与阈值处理。
  • 将不确定性分布与模型错误及未见恶意软件家族相关联,验证高不确定性可预测误判与分布外样本。
  • 提出一种综合评分指标,惩罚高FPR同时最大化TPR,实现在严格FPR约束下跨模型的公平比较。

实验结果

研究问题

  • RQ1先前研究中在测试集上选择阈值导致的错误阈值选择如何扭曲报告的TPR@FPR性能?正确的评估协议是什么?
  • RQ2从集成与贝叶斯模型中估计不确定性是否能显著提升极端FPR约束下(如1e-5)的TPR?
  • RQ3认知不确定性与随机不确定性在多大程度上与模型错误及训练期间未见的新型恶意软件家族相关?
  • RQ4在真实部署场景中,基于不确定性的阈值选择是否能优于朴素阈值选择,在保持低FPR的同时提升TPR?

主要发现

  • 先前对TPR@FPR的评估系统性地存在缺陷,因在测试集上选择阈值导致TPR被高估,相对误差至少达35%。
  • 所提出的基于不确定性的阈值选择方法,将Sophos数据集中最佳模型类在实际FPR为1e-5时的TPR从基线的0.69提升至0.80。
  • 即使中等程度的多样性或贝叶斯模型在低FPR环境下也显著提升了TPR,相较非集成基线最高提升11%。
  • 认知不确定性与随机不确定性评分与模型错误高度相关,使分析人员能够优先对高不确定性样本进行人工审查。
  • 不确定性分布能清晰区分已知与新型恶意软件家族:未见家族的样本表现出显著更高的不确定性,从而实现对新型威胁的早期检测。
  • 贝叶斯MalConv与LightGBM模型显示出高不确定性与新型恶意软件之间的强相关性,而更简单的模型(如贝叶斯逻辑回归)则无此关联,表明模型复杂度影响不确定性表达能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。