Skip to main content
QUICK REVIEW

[論文レビュー] Online Encrypted Skype Identification Based on an Updating Mechanism

Shi Dong|arXiv (Cornell University)|Mar 23, 2022
Internet Traffic Analysis and Secure E-voting被引用数 4
ひとこと要約

本稿では、サンプリングされたフローレコードからの暗号化されたSkypeトラフィック分類を向上させるために、オンラインベイジアン更新メカニズムを用いた新規なネットワークフローオンリジェクション(NFI)手法を提案する。拡張されたNETFLOW特徴量と高速相関ベースフィルタ(FCBF)特徴選択を活用することで、NFIモデルは94.6%のF-measureを達成し、精度において顕著に優れており、リアルタイムのトラフィック識別における誤検出および誤検出を低減する。

ABSTRACT

The machine learning algorithm is gaining prominence in traffic identification research as it offers a way to overcome the shortcomings of port-based and deep packet inspection, especially for P2P-based Skype. However,recent studies have focused mainly on traffic identification based on a full-packet dataset, which poses great challenges to identifying online network traffic. This study aims to provide a new flow identification algorithm by taking the sampled flow records as the object. The study constructs flow records from a Skype set as the dataset, considers the inherent NETFLOW and extended flow metrics as features, and uses a fast correlation-based filter algorithm to select highly correlated features. The study also proposes a new NFI method that adopts a Bayesian updating mechanism to improve the classifier model. The experimental results show that the proposed scheme can achieve much better identification performance than existing state-of-the-art traffic identification methods, and a typical feature metric is analyzed in the sampling environment. The NFI method improves identification accuracy and reduces false positives and false negatives compared to other methods.

研究の動機と目的

  • 完全パケットインスペクションが非現実的であるリアルタイムネットワーク環境において、暗号化されたSkypeトラフィックを同定する課題に対処すること。
  • P2P暗号化トラフィックを検出する際のポートベースおよびディープパケットインスペクション手法の限界を克服すること。
  • フルパケットデータセットではなく、サンプリングされたフローレコードを用いたスケーラブルでオンラインの分類システムの開発。
  • 変動するネットワーク環境下での分類精度を向上させるとともに、誤検出および誤検出を低減すること。
  • 将来的な暗号化トラフィック識別分野の研究ベンチマークとして用いられる標準化されたSKYPE-SETデータセットの確立。

提案手法

  • 実際のSkypeトラフィックからL7フィルタリングとネットワークフロー収集を用いてラベル付きのSKYPE-SETデータセットを構築する。
  • フロー持続時間、バイト数、パケットサイズ比、ポート情報などを含む拡張されたNETFLOW特徴量を抽出する。
  • 次元削減を実現しながらも予測性能を維持するため、最も情報量の多い特徴を選択するために高速相関ベースフィルタ(FCBF)を適用する。
  • 新しいフローデータサンプルに段階的に適合させるベイジアン更新メカニズムに基づく新規なNFIモデルを設計する。
  • さまざまなトレーニングデータサイズおよびフロー特性を想定し、10分割交差検証を用いてモデルのパフォーマンスを評価する。
  • 変化するトラフィックパターンに適応できるように、更新メカニズムを統合し、長期的な分類安定性と正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1サンプリングされたフローレコードのみを用いて、フルパケットデータではなく、フローベースの分類モデルが暗号化されたSkypeトラフィックを高い正確性で同定できるか?
  • RQ2拡張されたNETFLOWメトリクスからSkype識別に最も効果的な特徴を選択するために、高速相関ベースフィルタ(FCBF)はどの程度効果的か?
  • RQ3ベイジアン更新メカニズムは、オンライントラフィック識別における分類正確性をどの程度向上させ、誤検出および誤検出を低減するか?
  • RQ4F-measure、精度、再現率の観点から、提案手法のNFI手法は、最先端の手法(例:ナイーブベイズ、K-NN、PSO-RBF、BOF-NB)と比較してどの程度優れているか?
  • RQ5特定のフローフィーチャー(例:Lport、BPS、Doublepktratio)は、サンプリング環境下での正確なSkypeトラフィック分類にどの程度寄与しているか?

主な発見

  • 提案されたNFI手法は94.6%のF-measureを達成し、ナイーブベイズ(91.9%)、K-NN(92.5%)、PSO-RBF(93.5%)、BOF-NB(93.2%)の各手法を顕著に上回った。
  • FCBF特徴選択アルゴリズムは、分類に最も寄与する3つの特徴—Lport(0.711)、BPS(0.250)、Doublepktratio(0.166)—を同定した。
  • NFIモデルは、すべてのベースライン手法と比較して、フローサイズが10〜3000パケットを超えると、誤検出および誤検出率をより効果的に低減した。
  • ベイジアン更新メカニズムにより、継続的なモデルの最適化が可能となり、時間経過に伴い正確性が向上し、新しいトラフィックパターンへの適応性が向上した。
  • わずか16個のフローフィーチャーのみを用いても96.7%の全体的な正確性を達成した。これは、最小限の特徴セットでも優れたパフォーマンスを発揮することを示している。
  • 本研究では、双方向パケット長比やバイト数/持続時間といったフローベースのメトリクスが、サンプリング環境下でもSkypeトラフィックを識別する上で非常に特徴的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。