Skip to main content
QUICK REVIEW

[論文レビュー] Packet2Vec: Utilizing Word2Vec for Feature Extraction in Packet Data

Eric Goodman, Chase Zimmerman|arXiv (Cornell University)|Apr 29, 2020
Network Security and Intrusion Detection被引用数 5
ひとこと要約

この論文では、パケットの内容をn-gramの系列とみなすことにより、Word2Vecをネットワークパケットデータの特徴を自動で抽出できるように変更した新しい手法、Packet2Vecを紹介している。2009年DARPAデータセットにおいて、悪意あるトラフィックと良性トラフィックを分類するタスクで高い性能を達成し、AUC-ROCが0.988~0.996、AUC-PRが0.604~0.667の範囲に収まった。これは、手作業による特徴工学を用いずに、エンドツーエンドの特徴抽出に深層学習を適用する可能性を示している。

ABSTRACT

One of deep learning's attractive benefits is the ability to automatically extract relevant features for a target problem from largely raw data, instead of utilizing human engineered and error prone handcrafted features. While deep learning has shown success in fields such as image classification and natural language processing, its application for feature extraction on raw network packet data for intrusion detection is largely unexplored. In this paper we modify a Word2Vec approach, used for text processing, and apply it to packet data for automatic feature extraction. We call this approach Packet2Vec. For the classification task of benign versus malicious traffic on a 2009 DARPA network data set, we obtain an area under the curve (AUC) of the receiver operating characteristic (ROC) between 0.988-0.996 and an AUC of the Precision/Recall curve between 0.604-0.667.

研究の動機と目的

  • 手作業による特徴設計の限界を解決する。これは、誤りを起こしやすく、ドメインの専門知識を要する。
  • Word2Vecのような深層学習手法が、生パケットデータから直接意味のある特徴を自動で抽出できるかどうかを検討する。
  • パケットコンテンツからエンドツーエンドの特徴学習が可能であり、実世界のサイバー脅威検出において高い分類性能を達成できることを示す。
  • ネットワークセキュリティ分析における従来の特徴工学の代替として、スケーラブルで自動化された手法を提供する。

提案手法

  • 各ネットワークパケットを、IPアドレスやポート情報を除外してバイトレベルの部分文字列(n-gram)の系列に変換する。これにより、パケットの内容に焦点を当てる。
  • Word2Vecを用いて、頻出するn-gramごとに密なベクトル表現(埋め込み)を学習し、パケット内容における意味的類似性を捉える。
  • パケット内に含まれるすべてのn-gramの埋め込みの平均を用いて、固定長の特徴ベクトルを生成する。式は:v(p) = (1/|p|) * Σ e(t) (すべてのt ∈ pに対して)。
  • スコアリングされた分類器(例:Scikit-learnを用いて)を、得られたパケットレベルの埋め込みに対して訓練し、良性と悪意あるトラフィックの二値分類を実行する。
  • 性能を向上させるためにC++でパイプラインを実装し、Boost.Pythonを介してPythonからアクセス可能にし、std::threadを用いて並列処理を実装して大規模データを処理可能にする。
  • 2009年DARPAネットワークデータセットをトレーニングおよび評価のベンチマークとして使用し、558 GBを超える生パケットデータを処理した。

実験結果

リサーチクエスチョン

  • RQ1手作業による特徴設計に依存せずに、生パケットデータから意味のある特徴をWord2Vecで効果的に抽出できるか?
  • RQ2従来の特徴ベースのアプローチと比較して、深層学習に基づく特徴抽出手法は、良性と悪意あるネットワークトラフィックを分類するタスクでどの程度の性能を示すか?
  • RQ3IPアドレスやポートのメタデータを無視することで、モデルの悪意ある行動検出能力にどのような影響が生じるか?
  • RQ4大規模なネットワークトラフィックデータを効率的に処理できる、スケーラブルなエンドツーエンドの深層学習パイプラインを構築できるか?
  • RQ5同じベンチマークデータセットにおいて、Packet2Vecの性能は既存の手法と比較してどうなるか?

主な発見

  • Packet2Vecモデルは、2009年DARPAネットワークデータセットにおいて、受信者操作特性曲線下の面積(AUC-ROC)が0.988~0.996の範囲に達し、良性と悪意あるトラフィックの識別能力が非常に高いことを示した。
  • 精度-再現曲線のAUCが0.604~0.667の範囲にあり、不均衡な検出シナリオにおいても良好な性能を示した。
  • IPアドレスやポートなどのメタデータを含むドメイン固有の特徴設計を一切行わず、生パケットコンテンツから意味のある表現を学習できた。
  • C++ベースで並列処理が可能な実装を用いて、558 GBを超える生パケットデータを処理するスケーラビリティを示した。
  • 同じデータセットで先行研究(フローレベル特徴や時間的集約を用いた手法を含む)と比較したところ、平均適合率が0.03、再現率が0.08向上し、著しく高い検出性能を達成した。
  • 結果から、深層学習はパケットペイロードから関連する特徴を効果的に抽出でき、インシデント検出における人的に負担が大きい特徴工学への依存を減らせる可能性があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。