Skip to main content
QUICK REVIEW

[论文解读] Autonomous Unknown-Application Filtering and Labeling for DL-based Traffic Classifier Update

Jielun Zhang, Fuhao Li|arXiv (Cornell University)|Feb 15, 2020
Internet Traffic Analysis and Secure E-voting参考文献 25被引用 8
一句话总结

本文提出了一种自主框架,通过实时过滤未知应用数据包并将其自标注为新类别,实现深度学习(DL)流量分类器的自主更新。该系统结合深度学习分类器、自学习判别器和自标注模型,生成新的训练数据以支持迁移学习,从而在无需人工干预的情况下实现对先前未见过的应用的准确分类。

ABSTRACT

Network traffic classification has been widely studied to fundamentally advance network measurement and management. Machine Learning is one of the effective approaches for network traffic classification. Specifically, Deep Learning (DL) has attracted much attention from the researchers due to its effectiveness even in encrypted network traffic without compromising neither user privacy nor network security. However, most of the existing models are created from closed-world datasets, thus they can only classify those existing classes previously sampled and labeled. In this case, unknown classes cannot be correctly classified. To tackle this issue, an autonomous learning framework is proposed to effectively update DL-based traffic classification models during active operations. The core of the proposed framework consists of a DL-based classifier, a self-learned discriminator, and an autonomous self-labeling model. The discriminator and self-labeling process can generate new dataset during active operations to support classifier update. Evaluation of the proposed framework is performed on an open dataset, i.e., ISCX VPN-nonVPN, and independently collected data packets. The results demonstrate that the proposed autonomous learning framework can filter packets from unknown classes and provide accurate labels. Thus, corresponding DL-based classification models can be updated successfully with the autonomously generated dataset.

研究动机与目标

  • 解决现有基于深度学习的流量分类器在封闭世界假设下运行的局限性,这些分类器无法识别新出现的未知应用。
  • 实现在网络活动过程中无需人工重新训练或标注的实时模型更新。
  • 开发一个自动化流程,用于检测、聚类并标注未知应用流量,以支持分类器的再训练。
  • 确保即使对于加密的和此前未见过的网络应用,也能保持高分类准确率。
  • 通过迁移学习实现将新应用类别无缝集成到现有深度学习模型中。

提出的方法

  • 部署一个基于深度学习的流量分类器,该分类器使用封闭世界数据集中的已知应用类别进行训练。
  • 引入一个自学习判别器,以识别并过滤属于未知应用的数据包。
  • 应用自标注模型,将未知数据包聚类为新类别,并基于特征相似性分配一致的标签。
  • 构建一个新的训练数据集,结合原始标注数据与自主标注的未知类别数据包。
  • 利用迁移学习,使用新生成的数据集微调原始分类器,以提升泛化能力。
  • 使用来自 ISCX VPN-nonVPN 数据集的真实世界数据以及独立捕获的流量对框架进行验证。

实验结果

研究问题

  • RQ1自主系统是否能够在实际运行过程中检测并隔离来自未知应用的网络数据包?
  • RQ2自标注模型在多大程度上能将未知数据包聚类为有意义且互不重叠的应用类别?
  • RQ3当使用自主生成的数据进行再训练时,迁移学习在多大程度上能提升分类器的性能?
  • RQ4在开放世界场景下,该框架在不同网络条件和应用类型中的表现如何?
  • RQ5该系统是否能在保持高分类准确率的同时,最大限度减少对未知类别的误报和漏报?

主要发现

  • 该框架以高精度成功过滤了未知应用的数据包,显著减少了对已知类别分类的干扰。
  • 自标注模型能有效将未知数据包聚类为逻辑清晰的类别,实现无需人工监督的准确标签分配。
  • 使用自主生成数据进行迁移学习可显著提升分类器对未见过应用的准确率,展现出强大的泛化能力。
  • 在 ISCX VPN-nonVPN 数据集和真实世界流量上的评估表明,该框架在多种场景和分类器架构下均表现出一致的性能。
  • 所提出的系统实现了持续的、自主的模型更新,显著降低了对人工重新训练和标注的需求。
  • 即使在运行过程中出现新型应用类型,该框架仍能保持较高的整体分类准确率(约 95%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。