Skip to main content
QUICK REVIEW

[论文解读] Packet2Vec: Utilizing Word2Vec for Feature Extraction in Packet Data

Eric Goodman, Chase Zimmerman|arXiv (Cornell University)|Apr 29, 2020
Network Security and Intrusion Detection被引用 5
一句话总结

本文提出 Packet2Vec,一种新颖的方法,通过将数据包内容视为 n-gram 序列,将 Word2Vec 适配于原始网络数据包,实现自动提取特征。该方法在 2009 年 DARPA 数据集上对良性与恶意流量分类表现出高精度,AUC-ROC 在 0.988–0.996 之间,AUC-PR 在 0.604–0.667 之间,证明了深度学习在无需手工特征工程的情况下,实现端到端特征提取在网络安全异常检测中的可行性。

ABSTRACT

One of deep learning's attractive benefits is the ability to automatically extract relevant features for a target problem from largely raw data, instead of utilizing human engineered and error prone handcrafted features. While deep learning has shown success in fields such as image classification and natural language processing, its application for feature extraction on raw network packet data for intrusion detection is largely unexplored. In this paper we modify a Word2Vec approach, used for text processing, and apply it to packet data for automatic feature extraction. We call this approach Packet2Vec. For the classification task of benign versus malicious traffic on a 2009 DARPA network data set, we obtain an area under the curve (AUC) of the receiver operating characteristic (ROC) between 0.988-0.996 and an AUC of the Precision/Recall curve between 0.604-0.667.

研究动机与目标

  • 为解决网络入侵检测中手工特征的局限性,这些特征易出错且需要领域专业知识。
  • 探索类似 Word2Vec 的深度学习技术是否能直接从原始数据包数据中自动提取有意义的特征。
  • 证明仅从数据包内容进行端到端特征学习即可在真实世界网络威胁检测中实现高性能分类。
  • 为网络安全部数据分析提供一种可扩展、自动化的传统特征工程替代方案。

提出的方法

  • 通过提取字节级子串,将每个网络数据包转换为 n-gram 序列,丢弃 IP 和端口信息,以聚焦于内容。
  • 应用 Word2Vec 学习每个高频 n-gram 的密集向量嵌入,捕捉数据包内容中的语义相似性。
  • 通过公式 v(p) = (1/|p|) * Σ e(t) 对所有 t ∈ p 计算数据包内所有 n-gram 嵌入的平均值,生成每个数据包的固定大小特征向量。
  • 在生成的数据包级嵌入上训练监督分类器(例如使用 Scikit-learn),用于良性与恶意流量的二分类。
  • 使用 C++ 实现该流水线以提升性能,通过 Boost.Python 暴露给 Python,并使用 std::thread 并行化以处理大规模数据。
  • 使用 2009 年 DARPA 网络数据集作为训练和评估基准,处理超过 558 GB 的原始数据包数据。

实验结果

研究问题

  • RQ1Word2Vec 是否能有效适配于从原始网络数据包数据中提取有意义的特征,而无需依赖手工设计的特征?
  • RQ2与传统基于特征的方法相比,基于深度学习的特征提取方法在分类良性与恶意网络流量方面的表现如何?
  • RQ3忽略 IP 和端口元数据对模型检测恶意行为能力有何影响?
  • RQ4能否构建一个可扩展的、端到端的深度学习流水线,以高效处理大规模网络流量数据?
  • RQ5在相同基准数据集上,Packet2Vec 方法的性能与现有方法相比如何?

主要发现

  • Packet2Vec 模型在 2009 年 DARPA 网络数据集上实现了受试者工作特征曲线下面积(AUC-ROC)在 0.988 至 0.996 之间,表明其对良性与恶意流量具有强大的区分能力。
  • 该模型在精确率-召回率曲线下面积(AUC)介于 0.604 至 0.667 之间,表明其在类别不平衡检测场景中表现稳健。
  • 该方法成功从原始数据包内容中学习到有意义的表示,而无需依赖特定领域的特征工程或如 IP 地址和端口等元数据。
  • 该方法表现出良好的可扩展性,使用基于 C++ 的并行实现与 Python 集成,成功处理超过 558 GB 的原始数据包数据。
  • 与同一数据集上的先前工作相比,包括使用流级特征或时间聚合的方法,Packet2Vec 在平均精确率上高出 0.03,在召回率上高出 0.08,检测性能显著更优。
  • 结果表明,深度学习能够有效从数据包载荷中直接提取相关特征,从而减少入侵检测中对耗时的手工特征工程的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。