[论文解读] Leveraging Machine Learning for Ransomware Detection
本文提出了一种基于机器学习的勒索软件检测系统,通过分析可执行文件的行为特征,利用从 Cuckoo Sandbox 提取的静态和动态分析特征。XGBoost 和逻辑回归模型均实现了 98.21% 的准确率,其中 XGBoost 的召回率达到 99%,在零日场景下表现出色,能够有效识别勒索软件行为。
The current pandemic situation has increased cyber-attacks drastically worldwide. The attackers are using malware like trojans, spyware, rootkits, worms, ransomware heavily. Ransomware is the most notorious malware, yet we did not have any defensive mechanism to prevent or detect a zero-day attack. Most defensive products in the industry rely on either signature-based mechanisms or traffic-based anomalies detection. Therefore, researchers are adopting machine learning and deep learning to develop a behaviour-based mechanism for detecting malware. Though we have some hybrid mechanisms that perform static and dynamic analysis of executable for detection, we have not any full proof detection proof of concept, which can be used to develop a full proof product specific to ransomware. In this work, we have developed a proof of concept for ransomware detection using machine learning models. We have done detailed analysis and compared efficiency between several machine learning models like decision tree, random forest, KNN, SVM, XGBoost and Logistic Regression. We obtained 98.21% accuracy and evaluated various metrics like precision, recall, TP, TN, FP, and FN.
研究动机与目标
- 开发一种基于行为特征、由机器学习驱动的勒索软件检测系统,以克服基于签名和基于流量方法的局限性。
- 使用真实可执行文件行为数据,评估并比较多种监督学习模型在勒索软件检测中的表现。
- 构建一个概念验证系统,可集成到 EDR 和 SIEM 等企业安全框架中,实现实时威胁检测。
- 通过分析系统级行为(如文件操作、注册表修改和进程活动)应对零日勒索软件检测的挑战。
- 通过与 ELK(Elasticsearch、Logstash、Kibana)等开源日志和可视化堆栈集成,实现可扩展的部署。
提出的方法
- 收集勒索软件和良性(goodware)可执行文件样本用于训练和测试。
- 在 Cuckoo Sandbox 中执行所有样本,以捕获详细的系统级行为,包括文件操作、注册表修改和网络活动。
- 从沙箱日志中提取 122 项行为特征,如文件写入次数、注册表键创建次数和进程生成次数。
- 训练并评估六种机器学习模型:决策树、随机森林、K-近邻、支持向量机(SVM)、XGBoost 和逻辑回归。
- 使用标准评估指标(包括准确率、精确率、召回率以及混淆矩阵的组成部分:TP、TN、FP、FN)比较模型性能。
- 提出将训练好的模型与 EDR 和 SIEM 系统集成,并通过 ELK 堆栈演示了日志摄入、存储和可视化的可行性。
实验结果
研究问题
- RQ1基于从沙箱执行中提取的行为特征,哪种机器学习模型在勒索软件检测中达到最高的检测准确率?
- RQ2在区分勒索软件和良性可执行文件时,不同模型在精确率和召回率方面的表现如何?
- RQ3基于行为的机器学习模型是否能有效检测零日勒索软件变种,而无需依赖已知签名或网络异常?
- RQ4从沙箱日志中进行特征工程对模型泛化能力和检测鲁棒性有何影响?
- RQ5如何将训练好的机器学习模型集成到现有的企业安全基础设施(如 EDR、SIEM 或 ELK)中,以实现实时监控?
主要发现
- XGBoost 和逻辑回归模型实现了最高的 98.21% 准确率,在检测能力和泛化能力方面优于其他模型。
- XGBoost 达到了 99% 的召回率,表明其正确识别了 99% 的实际勒索软件样本,仅在 188 个真正阳性样本中出现 2 个假阴性。
- XGBoost 的精确率为 96%,意味着 96% 的被标记为勒索软件的预测是正确的,显著减少了误报。
- SVM 和随机森林分别实现了 96.42% 和 96.02% 的准确率,表现良好,但仍逊于 XGBoost 和逻辑回归。
- 混淆矩阵显示,XGBoost 的表现最为均衡,包含 188 个真正阳性、306 个真阴性、7 个假阳性以及仅 2 个假阴性。
- 本研究证明,基于沙箱执行日志的行为型机器学习检测方法是一种可行且有效的勒索软件识别方法,即使在零日场景下也表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。