Skip to main content
QUICK REVIEW

[논문 리뷰] Extensible Machine Learning for Encrypted Network Traffic Application Labeling via Uncertainty Quantification

Steven M. Jorgensen, John T. Holodnak|arXiv (Cornell University)|2022. 05. 11.
Internet Traffic Analysis and Secure E-voting인용 수 5
한 줄 요약

이 논문은 외부 분포(out-of-distribution, OOD) 트래픽을 탐지하기 위해 불확실성 정량화를 사용하는 암호화된 네트워크 트래픽 분류를 위한 새로운 기계학습 프레임워크를 제안한다. 웨이블릿 기반 특징, 상대 마할라노비스 거리와 함께 프로토타입 기반 네트워크, 그리고 校정된 p-값을 활용한 OOD 탐지 기반으로, 10개의 애플리케이션과 5개의 카테고리로 구성된 새로운 공개 데이터셋에서 F1 스코어 0.98를 달성하였으며, 재학습을 위한 새로운 트래픽을 효과적으로 경고한다.

ABSTRACT

With the increasing prevalence of encrypted network traffic, cyber security analysts have been turning to machine learning (ML) techniques to elucidate the traffic on their networks. However, ML models can become stale as new traffic emerges that is outside of the distribution of the training set. In order to reliably adapt in this dynamic environment, ML models must additionally provide contextualized uncertainty quantification to their predictions, which has received little attention in the cyber security domain. Uncertainty quantification is necessary both to signal when the model is uncertain about which class to choose in its label assignment and when the traffic is not likely to belong to any pre-trained classes. We present a new, public dataset of network traffic that includes labeled, Virtual Private Network (VPN)-encrypted network traffic generated by 10 applications and corresponding to 5 application categories. We also present an ML framework that is designed to rapidly train with modest data requirements and provide both calibrated, predictive probabilities as well as an interpretable "out-of-distribution" (OOD) score to flag novel traffic samples. We describe calibrating OOD scores using p-values of the relative Mahalanobis distance. We demonstrate that our framework achieves an F1 score of 0.98 on our dataset and that it can extend to an enterprise network by testing the model: (1) on data from similar applications, (2) on dissimilar application traffic from an existing category, and (3) on application traffic from a new category. The model correctly flags uncertain traffic and, upon retraining, accurately incorporates the new data.

연구 동기 및 목표

  • 알 수 없는 또는 새로운 애플리케이션에서 온 암호화된, VPN으로 보호된 네트워크 트래픽을 분류하는 데 도전하는 것.
  • 내부 분포 및 외부 분포 트래픽에 대해 校정된 예측 확률과 해석 가능한 불확실성 스코어를 제공하는 기계학습 모델을 개발하는 것.
  • 암호화된 트래픽 분류 연구를 지원하기 위해 10개의 애플리케이션과 5개의 카테고리로 구성된 공개된 레이블이 부여된 데이터셋을 만드는 것.
  • 불확실한 예측을 경고하고 새로운 데이터에 대한 점진적 재학습을 지원함으로써 빠른 모델 적응을 가능하게 하는 것.
  • 특징 공학, 모델 아키텍처, 불확실성 정량화를 통합한 유일하고 견고한 파이프라인을 사이버보안 응용 분야에 통합하는 것.

제안 방법

  • 프레임워크는 임베딩 공간 내에서 학습된 클래스 프로토타입까지의 거리를 기반으로 클래스 확률을 계산하는 프로토타입 기반 네트워크를 사용한다.
  • 이러한 방법으로 전방 및 후방 연결 크기에 이산 웨이블릿 변환(DWT)을 적용하여 상대 웨이블릿 에너지, 샤논 엔트로피, 세부 계수의 절대 평균 및 표준편차와 같은 특징을 추출한다.
  • 샘플이 클래스 프로토타입으로부터의 거리를 측정하기 위해 상대 마할라노비스 거리가 사용되며, 그 분포에서 유도된 p-값을 통해 불확실성을 정량화한다.
  • 불확실성은 상대 마할라노비스 거리의 p-값을 통해 정량화되며, 이는 校정된 OOD 탐지 기능을 가능하게 한다.
  • 시간에 따라 분할된 패킷 통계와 웨이블릿 특징을 사용하여, 10개의 애플리케이션(예: Netflix, SSH, VoIP)이 포함된 새로운 공개 데이터셋을 기반으로 모델을 훈련한다.
  • 파이프라인은 벡터 길이가 2의 거듭제곱이 되도록 신호 반사(signal reflection)를 적용하며, 특징은 40.96초 창에서 10ms 시간 간격으로 계산된다.

실험 결과

연구 질문

  • RQ1기계학습 모델이 새로운 또는 외부 분포 샘플에 대해 신뢰할 수 있는 불확실성 추정치를 제공하면서도 암호화된 네트워크 트래픽 분류에서 높은 정확도를 달성할 수 있는가?
  • RQ2p-값 校정이 함께된 상대 마할라노비스 거리는 암호화된 네트워크 플로우에서 외부 분포 트래픽 탐지에 얼마나 효과적인가?
  • RQ3제한된 레이블이 부여된 데이터셋에서 훈련된 모델이 기업 환경에서 유사한, 비유사한, 또는 완전히 새로운 애플리케이션 카테고리로 일반화하는 데 얼마나 효과적인가?
  • RQ4웨이블릿 기반 특징과 시간에 따라 분할된 패킷 통계는 암호화된 트래픽에서 분류 가능한 패턴을 포착하는 데 어떻게 비교되는가?
  • RQ5새로운 트래픽 카테고리가 등장했을 때 모델의 불확실성 스코어가 효과적인 재학습을 이끌 수 있는가?

주요 결과

  • 제안된 공개 데이터셋(10개 애플리케이션, 5개 카테고리)에서 모델은 F1 스코어 0.98을 달성하여 높은 분류 정확도를 보였다.
  • 모델은 校정된 불확실성 스코어를 통해 외부 분포 트래픽을 성공적으로 경고하며, 훈련 세트에 포함되지 않은 새로운 애플리케이션을 탐지할 수 있었다.
  • 유사한 애플리케이션, 기존 카테고리의 비유사 트래픽, 그리고 완전히 새로운 카테고리로 테스트한 결과, 모델은 불확실성을 정확히 식별하고 재학습 시에 적응함을 보였다.
  • ∆t = 0.01s 및 T = 40.96s의 선택된 설정이 특징 벡터 길이를 관리 가능한 수준으로 유지하면서도 최대 근접 정확도를 제공한다.
  • 웨이블릿 기반 특징, 특히 상대 웨이블릿 에너지와 샤논 엔트로피의 사용은 암호화된 트래픽에 대한 분류 능력을 크게 향상시켰다.
  • 상대 마할라노비스 거리의 p-값을 통한 불확실성 정량화 통합은 저신뢰도 예측 및 새로운 트래픽을 신뢰성 있게 탐지할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.