Skip to main content
QUICK REVIEW

[论文解读] An AI-based, Multi-stage detection system of banking botnets

Ling Li, Zhiqiang Gao|arXiv (Cornell University)|Jul 18, 2019
Spam and Phishing Detection参考文献 6被引用 4
一句话总结

本文提出了一种基于人工智能的多阶段银行木马检测系统,利用网络安全数据湖和深度学习模型(特别是LSTM网络)实现早期预警、DGA检测、钓鱼URL识别和DNS隧道检测。与基线模型相比,该系统将误报率降低了10倍,DGA检测的AUC得分为0.9965,钓鱼URL分类的AUC得分为0.9956。

ABSTRACT

Banking Trojans, botnets are primary drivers of financially-motivated cybercrime. In this paper, we first analyzed how an APT-based banking botnet works step by step through the whole lifecycle. Specifically, we present a multi-stage system that detects malicious banking botnet activities which potentially target the organizations. The system leverages Cyber Data Lake as well as multiple artificial intelligence techniques at different stages. The evaluation results using public datasets showed that Deep Learning based detections were highly successful compared with baseline models.

研究动机与目标

  • 应对高级持续性威胁(APT)型银行木马带来的日益严峻威胁,此类木马可规避传统检测手段,且平均潜伏时间长达498天。
  • 降低在高流量网络环境中木马检测的误报率,这对实际部署至关重要。
  • 在完整系统被攻陷前,实现对定向钓鱼攻击活动和恶意基础设施的早期检测。
  • 将多种人工智能技术(LSTM、图分析)整合到统一的检测框架中,利用集中化的网络安全数据湖作为数据基础。
  • 通过在公开和内部威胁数据上应用深度学习,提升在攻击杀伤链多个阶段的检测准确性。

提出的方法

  • 利用网络安全数据湖作为集中平台,摄取、标准化并存储来自内部和外部来源的多样化安全数据集。
  • 采用与攻击杀伤链(CKC)模型对齐的多阶段检测流水线,覆盖侦察、投递、利用、命令与控制(C2)以及目标行动等阶段。
  • 应用长短期记忆(LSTM)网络,基于域名名称的字符级序列对域名进行分类,判断其为恶意(DGA生成)或良性。
  • 采用基于LSTM的模型进行钓鱼URL检测,输入序列为最长128个字符,利用字符嵌入和dropout(0.5)进行正则化处理。
  • 在训练过程中应用早停法和超参数调优以防止过拟合,使用ROC曲线和AUC进行模型评估。
  • 在实际运行阶段应用白名单和黑名单机制,以减少噪声并提高检测精度。

实验结果

研究问题

  • RQ1与传统的n-gram和词袋模型基线相比,LSTM等深度学习模型是否能显著降低DGA和钓鱼URL检测中的误报率?
  • RQ2基于网络安全数据湖的多阶段检测系统在多大程度上能够覆盖整个攻击生命周期(包括早期侦察阶段)检测木马活动?
  • RQ3当在公开数据集上进行训练并使用AUC和FPR指标评估时,基于LSTM的模型在识别恶意域名和URL方面的有效性如何?
  • RQ4将LSTM和图分析等人工智能技术整合是否能够提升检测准确率并缩短银行木马攻击的潜伏时间?
  • RQ5在使用先进深度学习模型与传统机器学习模型时,检测率与误报率之间的性能权衡如何?

主要发现

  • LSTM模型在DGA分类任务中取得了0.9965的AUC,显著优于基线n-gram模型(AUC 0.9610)。
  • 在钓鱼URL检测任务中,LSTM模型的AUC达到0.9956,而基线词袋模型的AUC为0.9687。
  • 在真正例率91%的条件下,LSTM模型的误报率仅为0.7%,而基线模型在相同检测阈值下的误报率高达8%。
  • 在相同检测率下,LSTM模型相比基线模型将误报率降低了10倍以上,显示出在高流量环境中的强大实用价值。
  • 训练历史分析表明,LSTM模型未出现过拟合现象,因为其验证性能在各训练周期中保持稳定且一致。
  • 该系统在GPU集群上采用硬件优化的LSTM推理后,实现了6倍的加速,支持在生产环境中实现可扩展的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。