Skip to main content
QUICK REVIEW

[论文解读] Nested Multiple Instance Learning in Modelling of HTTP network traffic

Tomáš Pevný, Marek Dědič|arXiv (Cornell University)|Feb 10, 2020
Network Security and Intrusion Detection参考文献 34被引用 5
一句话总结

本文提出一种嵌套多重实例学习(MIL)框架,用于建模HTTP网络流量以检测受感染的计算机,利用分层URL结构而无需人工设计特征。通过将每台计算机的完整流量视为URL实例的‘袋’,并使用标记级表示(如3-gram),该模型在未见过的恶意软件家族的零样本检测中,优于基于人工特征和卷积神经网络(CNN)的现有方法。

ABSTRACT

In many interesting cases, the application of machine learning is hindered by data having a complicated structure stimulated by a structured file-formats like JSONs, XMLs, or ProtoBuffers, which is non-trivial to convert to a vector / matrix. Moreover, since the structure frequently carries a semantic meaning, reflecting it in the machine learning model should improve the accuracy but more importantly it facilitates the explanation of decisions and the model. This paper demonstrates on the identification of infected computers in the computer network from their HTTP traffic, how to achieve this reflection using recent progress in multiple-instance learning. The proposed model is compared to complementary approaches from the prior art, the first relying on human-designed features and the second on automatically learned features through convolution neural networks. In a challenging scenario measuring accuracy only on unseen domains/malware families, the proposed model is superior to the prior art while providing a valuable feedback to the security researchers. We believe that the proposed framework will found applications elsewhere even beyond the field of security.

研究动机与目标

  • 解决在机器学习中建模具有语义结构的分层网络流量(如URL)而无需依赖人工设计特征的挑战。
  • 通过分析每台计算机的完整HTTP流量而非单个URL,提升对受感染主机的检测能力,从而识别出细微的行为异常。
  • 通过识别导致分类决策的特定URL组件,提升模型的可解释性。
  • 开发一种可扩展的、端到端可训练的框架,使学习过程反映数据层次结构,从而提高对未见恶意软件家族的泛化能力。
  • 在真实网络流量上,证明该框架在跨领域、零样本评估中优于现有方法。

提出的方法

  • 该模型将每台计算机的HTTP流量视为一个‘袋’的URL实例,每个URL被分解为结构化组件(协议、主机名、路径、查询),并使用3-gram进行分词。
  • 采用嵌套MIL架构:内部MIL问题处理单个URL标记(如3-gram),外部MIL模型则聚合这些结果以对整台计算机进行感染或清洁的分类。
  • 通过分层MIL建模可变长度序列,避免固定长度填充或截断,从而保留结构语义。
  • 使用可微分评分函数学习URL标记的表示,并在实例(URL)和袋(计算机)之间聚合,支持端到端训练。
  • 该方法通过自定义库(Mill.jl)实现,以简化在分层数据中复用嵌套MIL结构的部署与扩展。
  • 模型仅使用计算机级别的粗粒度标签(感染或未感染)进行端到端训练,无需实例级别的标签。

实验结果

研究问题

  • RQ1嵌套多重实例学习框架是否能通过建模分层URL结构而无需人工设计特征,提升恶意软件检测的准确性?
  • RQ2与单独分析单个URL相比,建模完整计算机流量是否能增强对仅在合法服务器上改变流量分布的隐蔽恶意软件的检测能力?
  • RQ3该模型是否能通过识别导致感染分类的特定URL组件,提供可解释的反馈?
  • RQ4与现有方法相比,该模型在零样本评估(对未见过的恶意软件家族或域名)中的表现如何?
  • RQ5该框架是否能泛化到网络安全部以外的其他领域,适用于具有复杂分层数据结构的应用?

主要发现

  • 所提出的模型在未见过的恶意软件家族的零样本检测中,显著优于基于人工特征的基线方法(R. Forest模型)和基于CNN的方法(exPose)。
  • 该模型在未见过的域名上实现了更高的准确率,证明其凭借分层、结构感知的设计具有强大的泛化能力。
  • 该模型通过识别导致阳性分类的特定URL标记(如3-gram),提供可解释的反馈,可生成可操作的入侵指标。
  • 该框架支持从计算机级别的粗粒度标签进行端到端训练,相比实例级别标签,显著降低了标注工作量并提高了标注准确性。
  • 由于嵌套MIL方法的内在灵活性,即使在URL未被截断或填充的情况下,模型性能依然稳健。
  • 作者发布了Mill.jl库,以促进该框架在具有分层数据的其他领域中的采用与扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。