Skip to main content
QUICK REVIEW

[論文レビュー] TEST: an End-to-End Network Traffic Examination and Identification Framework Based on Spatio-Temporal Features Extraction

Yi Zeng, Zihao Qi|arXiv (Cornell University)|Aug 26, 2019
Internet Traffic Analysis and Secure E-voting参考文献 19被引用数 9
ひとこと要約

本論文は、生のネットワークトラフィックから空間的特徴(畳み込みニューラルネットワーク(CNN)を用いて)および時間的特徴(LSTMを用いて)を同時に抽出する、エンドツーエンドの深層学習ベースのフレームワークTESTを提案する。このフレームワークにより、暗号化トラフィック分類およびインシデント検出の高精度化が実現される。バランスの取れたデータセットを用いた3層階層構造を採用することで、8クラスのトラフィックデータセットにおいて、最先端の99.98%の精度を達成し、空間的または時間的特徴のみを用いるモデルを上回る性能を示した。

ABSTRACT

With more encrypted network traffic gets involved in the Internet, how to effectively identify network traffic has become a top priority in the field. Accurate identification of the network traffic is the footstone of basic network services, say QoE, bandwidth allocation, and IDS. Previous identification methods either cannot deal with encrypted traffics or require experts to select tons of features to attain a relatively decent accuracy.In this paper, we present a Deep Learning based end-to-end network traffic identification framework, termed TEST, to avoid the aforementioned problems. CNN and LSTM are combined and implemented to help the machine automatically extract features from both special and time-related features of the raw traffic. The presented framework has two layers of structure, which made it possible to attain a remarkable accuracy on both encrypted traffic classification and intrusion detection tasks. The experimental results demonstrate that our model can outperform previous methods with a state-of-the-art accuracy of 99.98%.

研究の動機と目的

  • 暗号化とプライバシー保護を重視するプロトコルの増加に伴い、暗号化済みで悪意あるネットワークトラフィックを正確に分類する課題に対処すること。
  • 従来の手法が手動による特徴工学に依存するか、暗号化トラフィックに対して効果を発揮しないという限界を克服すること。
  • 専門家が選定した特徴や個人情報の露呈を回避しながら、生のトラフィックから自動的に学習するエンドツーエンドの深層学習フレームワークを構築すること。
  • CNNとLSTMを組み合わせ、階層的かつバランスの取れた学習フレームワークで空間的および時間的トラフィックパターンを統合的にモデル化することで、分類の耐性および精度を向上させること。

提案手法

  • フレームワークは、3層階層構造(前処理層(P層)、一般分類層(G層)、特化型アクション層(S層))を採用し、モジュール化されたバランスの取れた学習を可能にする。
  • 空間的特徴は、生のトラフィックフロー・データから畳み込みニューラルネットワーク(CNN)を用いて抽出され、パケット列内の構造的パターンを捉える。
  • 時間的特徴は、長短期記憶(LSTM)ネットワークを用いて捉えられ、フローレートの時間的依存性をモデル化する。
  • 各分類層は、特定の設計に基づいたバランスの取れたデータセット上で学習され、すべてのトラフィッククラスにおいて高い安定した性能を確保する。
  • CNNとLSTMの統合により、ネットワークトラフィックの空間的および時間的次元からの共同学習が可能となり、特徴表現が強化される。
  • エンドツーエンドの設計により、手動による特徴選択の必要がなくなり、生のトラフィック入力に対して直接処理が可能となるため、プライバシーが保護される。

実験結果

リサーチクエスチョン

  • RQ1生のネットワークトラフィックから空間的および時間的特徴を共同でモデル化する深層学習フレームワークは、単一のモodal(空間的または時間的)特徴のみを用いるモデルと比較して、優れた分類精度を達成できるか?
  • RQ2階層的フレームワークにおけるバランスの取れたデータセットの使用は、多様なトラフィックタイプにわたる分類の耐性および精度にどのように影響するか?
  • RQ3エンドツーエンドの深層学習モデルは、手動による特徴工学やプロトコルレベルの解析に依存せずに、暗号化済みおよび悪意あるトラフィックをどの程度正確に特定できるか?
  • RQ4多層構造におけるCNNとLSTMの統合は、実世界のネットワークトラフィック分類タスクにおいて、顕著な性能向上をもたらすか?

主な発見

  • TESTは、8種類の異なるネットワークトラフィックを分類するタスクにおいて、最先端の99.98%の精度を達成し、ベースラインモデルを著しく上回った。
  • フレームワーク内でのCNNとLSTMの組み合わせにより、LeNet(80.27%)に対して19.71%、3層LSTM(81.96%)に対して17.92%の精度向上が達成された。
  • TESTは優れた耐性を示し、大多数のトラフィッククラスでF1スコアが1.0に達した。特にチャット、メール、ファイル転送トラフィックの分類において顕著な優位性を示した。
  • TESTの平均F1スコア(0.999)は、LeNet(0.851)やLSTM(0.864)を大幅に上回り、その高い安定性と性能の向上を裏付けた。
  • 空間的および時間的特徴を同時に活用することで、単一のモダリティのみを用いる場合と比較して、顕著に優れた分類性能が得られることを確認した。
  • フレームワークは、暗号化されていないトラフィックおよびマルウェアトラフィックに対しても高い性能を示したが、特に暗号化トラフィックにおいてその恩恵が顕著に現れ、共同特徴学習の価値を強力に示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。