Skip to main content
QUICK REVIEW

[논문 리뷰] How to Achieve High Classification Accuracy with Just a Few Labels: A Semi-supervised Approach Using Sampled Packets

Shahbaz Rezaei, Xin Liu|arXiv (Cornell University)|2018. 12. 23.
Internet Traffic Analysis and Secure E-voting인용 수 82
한 줄 요약

대량의 라벨이 없는 데이터에서 사전 학습된 반지도 학습 트래픽 분류기가 샘플링된 패킷으로 학습하고, QUIC 트래픽을 포함하여 클래스당 겨우 20개의 라벨이 붙은 흐름으로 거의 지도학습 수준의 정확도를 달성한다.

ABSTRACT

Network traffic classification, which has numerous applications from security to billing and network provisioning, has become a cornerstone of today's computer networks. Previous studies have developed traffic classification techniques using classical machine learning algorithms and deep learning methods when large quantities of labeled data are available. However, capturing large labeled datasets is a cumbersome and time-consuming process. In this paper, we propose a semi-supervised approach that obviates the need for large labeled datasets. We first pre-train a model on a large unlabeled dataset where the input is the time series features of a few sampled packets. Then the learned weights are transferred to a new model that is re-trained on a small labeled dataset. We show that our semi-supervised approach achieves almost the same accuracy as a fully-supervised method with a large labeled dataset, though we use only 20 samples per class. In tests based on a dataset generated from the more challenging QUIC protocol, our approach yields 98% accuracy. To show its efficacy, we also test our approach on two public datasets. Moreover, we study three different sampling techniques and demonstrate that sampling packets from an arbitrary portion of a flow is sufficient for classification.

연구 동기 및 목표

  • 네트워크 트래픽 분류를 위한 라벨링 데이터 필요성 감소를 동기부여한다.
  • 비라벨 데이터의 사전 학습과 소규모 라벨 재학습을 결합한 반지도 학습 파이프라인을 제안한다.
  • 효율적인 시계열 기반 분류를 가능하게 하는 패킷 샘플링 전략을 탐구한다.
  • QUIC와 공개 데이터셋 전반에 걸친 일반화 가능성을 보여준다.

제안 방법

  • 시간 시계열 샘플로부터 통계적 흐름 특징을 예측하기 위해 큰 라벨링이 없는 데이터셋에서 CNN을 사전 학습한다.
  • 학습된 가중치를 두 번째 모델로 전이하고 작은 라벨 데이터셋으로 재학습한다.
  • 샘플링된 패킷의 시계열 특징을 입력으로 사용하고 통계적 특징을 목표로 예측한다.
  • 고정 스텝, 무작위, 증가형 샘플링의 세 가지 샘플링 방법을 활용한다.
  • QUIC 트래픽과 공개 데이터셋으로 평가하고 완전한 지도 학습 기반 기준선과 비교한다.

실험 결과

연구 질문

  • RQ1라벨이 없는 데이터로 사전 학습된 모델이 정확한 트래픽 분류에 필요한 라벨 데이터의 양을 줄일 수 있는가?
  • RQ2제한된 라벨에서 다양한 패킷 샘플링 전략이 분류 성능에 어떤 영향을 미치는가?
  • RQ3라벨이 없는 데이터로부터의 전이 학습이 데이터셋과 프로토콜 간에 일반화되는가(예: QUIC)?

주요 결과

  • 반지도 학습 접근법은 QUIC 유래 데이터에서 클래스당 20개의 라벨링 흐름만으로 거의 완전 지도 학습 수준의 정확도를 달성한다(증가형 샘플링: 98.53% 대 상한 98.99%).
  • 증가형 샘플링은 일반적으로 정확도 향상에서 고정 스텝 및 무작위 샘플링보다 더 우수하다.
  • 일정 샘플링 설정에서 사전 학습된 모델은 비사전 학습 기준선에 비해 정확도를 약 10% 향상시킨다.
  • 타깃 트래픽이 사전 학습에 없을 때도 Waikato 데이터로의 사전 학습은 상당한 이점을 제공한다(약 10% 향상까지).
  • Ariel 공개 데이터에서 사전 학습과 소규모 라벨 재학습은 비교적 적은 수의 라벨 흐름으로 거의 상한에 근접한 성능에 도달한다(예: 클래스당 약 30개의 라벨 흐름으로 상한에 도달).
  • 통계적 특징을 이용한 랜덤 포레스트 기준선은 QUIC 데이터에서 99.87%를 달성하여 샘플링이 전체 특징 모델에 비해 성능을 약간 저하시키는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.