Skip to main content
QUICK REVIEW

[论文解读] Learning detectors of malicious web requests for intrusion detection in network traffic

Lukáš Machlica, Karel Bartoš|arXiv (Cornell University)|Feb 8, 2017
Network Security and Intrusion Detection被引用 6
一句话总结

该论文提出了一种可扩展的、基于学习的系统,通过从代理日志中提取的统计特征检测恶意网络流量,实现对恶意通信(尤其是C&C、网络钓鱼和点击欺诈)的高精度识别,且无需依赖签名、DNS或内容分析。该方法在真实企业网络流量中对恶意流量、URL和感染主机的检测精度超过95%。

ABSTRACT

This paper proposes a generic classification system designed to detect security threats based on the behavior of malware samples. The system relies on statistical features computed from proxy log fields to train detectors using a database of malware samples. The behavior detectors serve as basic reusable building blocks of the multi-level detection architecture. The detectors identify malicious communication exploiting encrypted URL strings and domains generated by a Domain Generation Algorithm (DGA) which are frequently used in Command and Control (C&C), phishing, and click fraud. Surprisingly, very precise detectors can be built given only a limited amount of information extracted from a single proxy log. This way, the computational requirements of the detectors are kept low which allows for deployment on a wide range of security devices and without depending on traffic context such as DNS logs, Whois records, webpage content, etc. Results on several weeks of live traffic from 100+ companies having 350k+ hosts show correct detection with a precision exceeding 95% of malicious flows, 95% of malicious URLs and 90% of infected hosts. In addition, a comparison with a signature and rule-based solution shows that our system is able to detect significant amount of new threats.

研究动机与目标

  • 解决基于签名和基于规则的系统在检测多态和零日恶意软件时的局限性。
  • 开发一种通用、可复用的检测架构,仅从最少的代理日志数据中识别恶意行为,而无需完整的流量上下文。
  • 仅使用代理日志中的统计特征,实现对加密或混淆URL(包括DGA生成的域名)的高精度检测,无需依赖DNS、WHOIS或网页内容。
  • 通过在单个代理日志条目中提取的紧凑、行为不变的特征上训练检测器,降低误报率和计算开销。
  • 通过仅对单个检测器进行增量再训练,实现对新威胁的快速适应,而无需重新训练整个系统。

提出的方法

  • 从代理日志字段(如URL路径、查询参数、域名)中提取统计特征,例如字符频率、n-gram分布、熵值以及特殊字符比例。
  • 在标记的恶意通信样本数据集上训练随机森林分类器,以检测恶意模式,包括DGA生成的域名和加密URL。
  • 设计多级检测器层次结构,使每个检测器专门针对特定类型的恶意行为(如C&C、网络钓鱼),从而提高精度并减少误报。
  • 仅使用代理日志数据——不包括DNS、WHOIS或网页内容——确保计算成本低,并可在各类安全设备中广泛部署。
  • 通过少量新样本对单个检测器进行增量再训练,实现对新兴威胁的快速适应。
  • 将系统与现有入侵检测系统集成,通过结合代理日志特征与上下文流量分析,提升整体检测能力。

实验结果

研究问题

  • RQ1仅使用代理日志中的统计特征,能否以高精度检测使用加密或DGA生成域名的恶意网络流量?
  • RQ2基于学习的系统若使用通用、非恶意软件特异的特征,在检测零日或多态恶意软件方面,与基于签名的方法相比效果如何?
  • RQ3在不依赖外部上下文的情况下,仅使用有限的代理日志训练数据,检测器性能能在多大程度上保持并得到提升?
  • RQ4与基于聚类或上下文密集的检测方法相比,模块化、多级检测器架构是否能有效降低误报率并提高计算效率?
  • RQ5系统支持对单个检测器进行再训练的能力,如何提升其在面对新型、此前未见的恶意行为时的可扩展性和适应性?

主要发现

  • 该系统在真实企业网络流量中对恶意网络流量、恶意URL和感染主机的检测精度超过95%。
  • 超过90%的感染主机仅通过代理日志特征即被正确识别,证明了该系统在大规模环境下的强大检测能力。
  • 系统在不依赖DNS日志、WHOIS数据或域名信誉数据的情况下,对DGA生成的域名实现了高精度检测。
  • 利用代理日志中的统计特征,能够有效检测常用于C&C、网络钓鱼和点击欺诈活动的加密或混淆URL。
  • 基于学习的方法检测到了大量此前未见过的威胁,在零日检测方面优于传统基于签名的解决方案。
  • 模块化、多级检测器架构支持各组件独立再训练,实现仅用少量数据即可快速适应新型恶意行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。