[論文レビュー] Lens: A Knowledge-Guided Foundation Model for Network Traffic
Lensは、T5エンコーダ・デコーダアーキテクチャを活用して、マスクスパン予測、パケット順序予測、同等トラフィック予測を組み合わせた新規のマルチタスク事前学習目的を用いて、大規模なラベルなしトラフィックデータから表現を学ぶネットワークトラフィック向けの基礎モデルである。これは、トラフィック理解および生成の両タスクで最先端の性能を達成し、従来の手法と比較してファインチューニングに必要なデータ量を50%〜95%まで削減する。
Network traffic refers to the amount of data being sent and received over the Internet or any system that connects computers. Analyzing network traffic is vital for security and management, yet remains challenging due to the heterogeneity of plain-text packet headers and encrypted payloads. To capture the latent semantics of traffic, recent studies have adopted Transformer-based pretraining techniques to learn network representations from massive traffic data. However, these methods pre-train on data-driven tasks but overlook network knowledge, such as masking partial digits of the indivisible network port numbers for prediction, thereby limiting semantic understanding. In addition, they struggle to extend classification to new classes during fine-tuning due to the distribution shift. Motivated by these limitations, we propose \Lens, a unified knowledge-guided foundation model for both network traffic classification and generation. In pretraining, we propose a Knowledge-Guided Mask Span Prediction method with textual context for learning knowledge-enriched representations. For extending to new classes in finetuning, we reframe the traffic classification as a closed-ended generation task and introduce context-aware finetuning to adapt to the distribution shift. Evaluation results across various benchmark datasets demonstrate that the proposed Lens~achieves superior performance on both classification and generation tasks. For traffic classification, Lens~outperforms competitive baselines substantially on 8 out of 12 tasks with an average accuracy of extbf{96.33\%} and extends to novel classes with significantly better performance. For traffic generation, Lens~generates better high-fidelity network traffic for network simulation, gaining up to extbf{30.46\%} and extbf{33.3\%} better accuracy and F1 in fuzzing tests. We will open-source the code upon publication.
研究の動機と目的
- 異種で暗号化されており意味論的に疎なネットワークトラフィックデータの分析という課題に対処すること。
- エンコーダーのみまたはデコーダーのみのアーキテクチャの制限を克服し、トラフィック理解と生成の両面で優れた性能を発揮する統合的基礎モデルを開発すること。
- ラベルなしトラフィックデータに対する有効な事前学習を活用することで、下流タスクにおける大規模ラベル付きデータへの依存度を低減すること。
- ネットワークトラフィック内のグローバル構造、シーケンス順序、関係的パターンを捉えるマルチタスク事前学習目的を設計すること。
- プロンプトベースのファインチューニングを用いて、多様なネットワークトラフィックタスクに強力なゼロショットおよびフェイントショット一般化を実現すること。
提案手法
- ネットワークトラフィックを16進数列にトークン化し、事前に定義された語彙を用いたWordPieceなどの複数のトークン化手法を評価する。
- エンコーダ・デコーダアテンションを介して理解と生成の両方の表現を統合的に学習するため、バックボーンモデルとしてT5アーキテクチャを採用する。
- 3つのタスクを組み合わせたマルチタスク事前学習目的を設計:マスクスパン予測(MSP)、パケット順序予測(POP)、同等トラフィック予測(HTP)。
- MSP(ノイズ除去)、POP(シーケンス順序モデリング)、HTP(クロスフロー関係学習)を同時に最適化する複合損失関数を用いる。
- ファインチューニング時にタスク固有のプロンプトを適用し、最小限のラベル付きデータでLensを下流タスクに適応させる。
- 標準指標を用いて性能を評価:理解タスクでは正解率/F1、生成タスクではJSD/TVD。
実験結果
リサーチクエスチョン
- RQ1T5アーキテクチャに基づく基礎モデルは、ラベルなしの生のネットワークトラフィックデータから潜在表現を効果的に学習できるか?
- RQ2MSP、POP、HTPを組み合わせたマルチタスク事前学習目的は、トラフィック理解および生成の両性能を向上させるか?
- RQ3Lensは、既存の事前学習手法と比較して、ファインチューニングに必要なラベル付きデータの量をどの程度削減できるか?
- RQ4Lensは、事前学習されたデータセットとは異なる多様なデータセットやネットワークトラフィックタスクに対し、どの程度一般化できるか?
- RQ5各事前学習タスク(MSP、POP、HTP)が最終的なモデル性能に果たす相対的寄与度はどの程度か?
主な発見
- Lensは、パケットレベルの理解タスクでベースライン比平均10.75%の正答率向上を達成し、フローレベルタスクでは0.59%の向上を示した。
- トラフィック生成において、LensはNetShareと比較して平均でJensen–Shannon Divergence(JSD)を62%、Total Variation Distance(TVD)を77%削減した。
- Lensは、事前学習されていなかったCrossPlatformデータセットを含め、すべての生成タスクでNetShareを上回った。
- ET-BERT や YaTC といった最先端手法と比較して、ファインチューニングに必要なラベル付きデータ量を50%〜95%まで削減できた。
- アブレーションスタディの結果、事前学習とMSPは生成性能にとって不可欠であり、MSPを除去するとJSDが77%上昇した。
- 3つの事前学習タスクをすべて含む完全なモデルが最高の性能を発揮し、MSP、POP、HTPが相補的であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。