[論文レビュー] Extensible Machine Learning for Encrypted Network Traffic Application Labeling via Uncertainty Quantification
本稿では、分布外(OOD)トラフィックを検出するために不確実性の定量化を用いた、暗号化ネットワークトラフィックを分類するための新しい機械学習フレームワークを提示する。ウェーブレットベースの特徴量、相対ミンコフスキー距離を用いたプロトタイプネットワーク、および補正されたp値を用いたOOD検出を組み合わせることで、10のアプリケーション(5つのカテゴリに分類)を含む新しい公開データセットにおいて0.98のF1スコアを達成するとともに、再訓練用に新たなトラフィックを効果的に特定している。
With the increasing prevalence of encrypted network traffic, cyber security analysts have been turning to machine learning (ML) techniques to elucidate the traffic on their networks. However, ML models can become stale as new traffic emerges that is outside of the distribution of the training set. In order to reliably adapt in this dynamic environment, ML models must additionally provide contextualized uncertainty quantification to their predictions, which has received little attention in the cyber security domain. Uncertainty quantification is necessary both to signal when the model is uncertain about which class to choose in its label assignment and when the traffic is not likely to belong to any pre-trained classes. We present a new, public dataset of network traffic that includes labeled, Virtual Private Network (VPN)-encrypted network traffic generated by 10 applications and corresponding to 5 application categories. We also present an ML framework that is designed to rapidly train with modest data requirements and provide both calibrated, predictive probabilities as well as an interpretable "out-of-distribution" (OOD) score to flag novel traffic samples. We describe calibrating OOD scores using p-values of the relative Mahalanobis distance. We demonstrate that our framework achieves an F1 score of 0.98 on our dataset and that it can extend to an enterprise network by testing the model: (1) on data from similar applications, (2) on dissimilar application traffic from an existing category, and (3) on application traffic from a new category. The model correctly flags uncertain traffic and, upon retraining, accurately incorporates the new data.
研究の動機と目的
- 未知または新しいアプリケーションからの暗号化済み、VPN保護済みネットワークトラフィックの分類の課題に対処すること。
- 分布内および分布外のトラフィックの両方に対して、補正された予測確率と解釈可能な不確実性スコアを提供する機械学習モデルを開発すること。
- 10のアプリケーションと5つのカテゴリを含む、研究を支援するための公開済みラベル付きデータセットを作成すること。
- 不確実な予測を特定することで、新しいデータに対する段階的再訓練を支援し、迅速なモデル適合を可能にすること。
- 特徴工学、モデルアーキテクチャ、不確実性の定量化を統合した、サイバーセキュリティ用途に適した包括的で堅牢なパイプラインを構築すること。
提案手法
- フレームワークは、埋め込み空間内でのクラスプロトタイプからの距離に基づいてクラス確率を計算するプロトタイプネットワークを使用する。
- 離散ウェーブレット変換(DWT)を前方および後方接続サイズに適用し、相対ウェーブレットエネルギー、シャノンエントロピー、および詳細係数の絶対平均と標準偏差を含む特徴量を抽出する。
- 相対ミンコフスキー距離を用いて、サンプルがクラスプロトタイプからの距離を測定し、その分布からのp値を導出することで不確実性を定量化する。
- 相対ミンコフスキー距離のp値を用いた不確実性の定量化により、補正されたOOD検出が可能になる。
- 時間帯に分けたパケット統計とウェーブレット特徴量を用いて、10のアプリケーション(例:Netflix、SSH、VoIP)を含む新しい公開データセット上でモデルを学習する。
- パイプラインには、ベクトル長を2の累乗に保つための信号反転処理が含まれており、特徴量は40.96秒のウィンドウ、10msの時間ボーリングで計算される。
実験結果
リサーチクエスチョン
- RQ1機械学習モデルは、未知または分布外のサンプルに対する信頼性の高い不確実性推定を提供しながら、暗号化ネットワークトラフィックの分類において高い正確性を達成できるか?
- RQ2補正されたp値を用いた相対ミンコフスキー距離は、暗号化ネットワークフローにおける分布外トラフィックの検出にどの程度効果的か?
- RQ3限定的でラベル付きのデータセットで学習したモデルは、企業環境における類似、相違、まったく新しいアプリケーションカテゴリにどの程度一般化できるか?
- RQ4ウェーブレットベースの特徴量と時間帯に分けたパケット統計は、暗号化トラフィックにおける特徴的パターンを捉える上で、どのように比較されるか?
- RQ5新しいトラフィックカテゴリが出現した際に、モデルの不確実性スコアは効果的な再訓練を促進できるか?
主な発見
- 本モデルは、10のアプリケーション(5つのカテゴリに分類)を含む提案された公開データセットにおいてF1スコア0.98を達成し、高い分類正確性を示している。
- 補正された不確実性スコアを用いて、トレーニングセットに含まれない新しいアプリケーションを効果的に特定している。
- 類似アプリケーション、既存カテゴリからの相違トラフィック、まったく新しいカテゴリのテストにおいて、モデルは不確実性を正しく識別し、再訓練後に適応している。
- ∆t = 0.01s および T = 40.96s の設定が、特徴ベクトル長を管理可能な範囲に保ちつつ、ほぼ最大の正確性を達成している。
- 特に相対ウェーブレットエネルギーとシャノンエントロピーを含むウェーブレットベースの特徴量の使用が、暗号化トラフィックにおける識別力の向上に顕著に寄与している。
- 相対ミンコフスキー距離のp値による不確実性の定量化の統合により、低信頼度の予測および新しいトラフィックの信頼性の高い検出が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。