[論文レビュー] Classification of Traffic Using Neural Networks by Rejecting: a Novel Approach in Classifying VPN Traffic
本稿では、マルチレイヤーパーセプトロン(MLP)と長短期記憶(LSTM)ネットワークを組み合わせたエンドツーエンドの段階的ニューラルネットワーク手法を提案し、拒否戦略を用いて暗号化されたVPNトラフィックを分類する。クラススコアとクラス中心からの距離を通じて特徴抽出、選択、分類を同時に学習することで、95%の精度を達成し、最先端のモデルを上回る。暗号化トラフィックの区別とアプリケーションタイプの同定においても効果的に機能する。
In this paper, we introduce a novel end-to-end traffic classification method to distinguish between traffic classes including VPN traffic in three layers of the Open Systems Interconnection (OSI) model. Classification of VPN traffic is not trivial using traditional classification approaches due to its encrypted nature. We utilize two well-known neural networks, namely multi-layer perceptron and recurrent neural network to create our cascade neural network focused on two metrics: class scores and distance from the center of the classes. Such approach combines extraction, selection, and classification functionality into a single end-to-end system to systematically learn the non-linear relationship between input and predicted performance. Therefore, we could distinguish VPN traffics from non-VPN traffics by rejecting the unrelated features of the VPN class. Moreover, we obtain the application type of non-VPN traffics at the same time. The approach is evaluated using the general traffic dataset ISCX VPN-nonVPN, and an acquired dataset. The results demonstrate the efficacy of the framework approach for encrypting traffic classification while also achieving extreme accuracy, $95$ percent, which is higher than the accuracy of the state-of-the-art models, and strong generalization capabilities.
研究の動機と目的
- パケットレベルでの暗号化のため、従来の手法では困難である暗号化されたVPNトラフィックの分類に取り組む。
- トラフィック分類における分割統治的手法の限界を克服するため、特徴抽出、選択、分類を1つのエンドツーエンド学習フレームワークに統合する。
- 特にVPNと非VPNトラフィックの区別およびアプリケーションタイプの同定において、分類精度と一般化性能を向上させる。
- 公開データセット(ISCX VPN-nonVPN)および実際のISPが収集したデータセットの両方で、提案手法の堅牢性と性能を検証する。
提案手法
- フレームワークは、マルチレイヤーパーセプトロン(MLP)と長短期記憶(LSTM)再帰ニューラルネットワークを組み合わせた段階的ニューラルネットワークアーキテクチャを採用し、トラフィックフローを段階的に処理する。
- 拒否戦略は、2つの指標(予測の信頼度であるクラススコア、予測クラスの中心からの距離)に基づいて入力サンプルを評価し、関連性のないまたは曖昧な特徴を除外可能にする。
- モデルは2つの損失関数(スコアベースと距離ベース)を用いてエンドツーエンドで訓練され、Adam最適化手法を用い、バリデーションセットを用いたハイパーパrameterチューニングが行われる。
- 特徴工学的処理は深層ネットワーク構造を通じて暗黙的に学習され、手動による特徴選択や前処理の必要性がなくなる。
- 1つの統合モデル内で特徴抽出、選択、分類を同時に実行することで、誤差伝搬を低減し、非線形関係のモデリングを向上させる。
- μ=0.85、λ=0.70、η=0.40、δ=0.30といったハイパーパrameterは、拒否しきい値を定義するために用いられ、堅牢性と一般化性能を確保する。
実験結果
リサーチクエスチョン
- RQ1拒否機構を備えた段階的ニューラルネットワークは、従来の分割統治的手法を上回り、暗号化されたVPNトラフィックの分類において優れた性能を示すか?
- RQ2特徴抽出と分類を統合したエンドツーエンド学習は、暗号化トラフィック分類における精度と一般化性能をどの程度向上させるか?
- RQ3クラススコアとクラス中心からの距離に基づく拒否戦略は、関連性のないまたは曖昧なトラフィック特徴を効果的にフィルタリングできるか?
- RQ4本手法は、チャット、メール、FTP、ストリーミング、VoIP、暗号化VPNトラフィックを含む多様なトラフィックタイプにおいても高い性能を維持するか?
- RQ5精度、適合率、再現率、F1スコアの観点から、最先端のエンドツーエンド学習モデルと比較して、本モデルの性能はどの程度高いか?
主な発見
- 提案された段階的ニューラルネットワークに拒否機構を組み合わせた手法は、テスト精度が95%に達し、最先端のE2Eモデル(86%)を8ポイントも上回る。
- 距離ベースの手法が最高の性能を示し、VPNトラフィックのF1スコアは0.93、適合率は0.94、再現率は0.93を記録し、強力な検出能力を示した。
- モデルは優れた一般化性能を示し、FTP や VoIP といった挑戦的なクラスを含む、すべてのトラフィックタイプで高い適合率と再現率を維持した。
- 距離ベースの手法がスコアベースの手法を上回り、スコアベース手法はわずか90%の精度にとどまった。これは距離ベースの拒否戦略の有効性を裏付けた。
- 最先端のEE-CNNモデルと比較して、再現率が1.4%、F1スコアが0.4%向上し、陽性ケースの検出能力が向上した。
- フレームワークは、非VPNトラフィックをアプリケーションタイプ(例:メール、ストリーミング)に分類すると同時に、暗号化されたVPNトラフィックを同定することができ、二重の機能を果たした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。