[논문 리뷰] Classification of Traffic Using Neural Networks by Rejecting: a Novel Approach in Classifying VPN Traffic
이 논문은 다층 퍼셉트론(MLP)과 장기 단기 기억(LSTM) 신경망을 조합한 새로운 엔드 투 엔드 캐스케이드 신경망 기반 접근법을 제안하며, 거부 전략을 통해 암호화된 VPN 트래픽을 분류한다. 클래스 점수와 클래스 중심에서의 거리 정보를 통합하여 특성 추출, 선택, 분류를 동시에 학습함으로써 95%의 정확도를 달성하였으며, 기존 최고 수준의 모델을 뛰어넘었고, 암호화된 트래픽을 효과적으로 구분하며 애플리케이션 유형을 식별하는 데 성공하였다.
In this paper, we introduce a novel end-to-end traffic classification method to distinguish between traffic classes including VPN traffic in three layers of the Open Systems Interconnection (OSI) model. Classification of VPN traffic is not trivial using traditional classification approaches due to its encrypted nature. We utilize two well-known neural networks, namely multi-layer perceptron and recurrent neural network to create our cascade neural network focused on two metrics: class scores and distance from the center of the classes. Such approach combines extraction, selection, and classification functionality into a single end-to-end system to systematically learn the non-linear relationship between input and predicted performance. Therefore, we could distinguish VPN traffics from non-VPN traffics by rejecting the unrelated features of the VPN class. Moreover, we obtain the application type of non-VPN traffics at the same time. The approach is evaluated using the general traffic dataset ISCX VPN-nonVPN, and an acquired dataset. The results demonstrate the efficacy of the framework approach for encrypting traffic classification while also achieving extreme accuracy, $95$ percent, which is higher than the accuracy of the state-of-the-art models, and strong generalization capabilities.
연구 동기 및 목표
- 패킷 수준의 암호화로 인해 전통적 방법으로는 분류가 어려운 암호화된 VPN 트래픽을 분류하는 데 도전한다.
- 트래픽 분류에서 분할-통합 접근법의 한계를 극복하기 위해 특성 추출, 선택, 분류를 하나의 엔드 투 엔드 학습 프레임워크로 통합한다.
- 특히 VPN과 비VPN 트래픽을 구분하고 애플리케이션 유형을 식별하는 데 있어 분류 정확도와 일반화 능력을 향상시킨다.
- 공개 데이터셋(ISCX VPN-nonVPN)과 실사용자 ISP가 수집한 데이터셋을 모두 활용하여 제안된 방법의 강건성과 성능을 평가한다.
제안 방법
- 프레임워크는 트래픽 플로우를 계층적으로 처리하기 위해 다층 퍼셉트론(MLP)과 장기 단기 기억(LSTM) 순환 신경망을 조합한 캐스케이드 신경망 아키텍처를 사용한다.
- 거부 전략은 예측된 클래스의 클래스 점수(예측 신뢰도)와 해당 클래스 중심에서의 거리 두 가지 지표를 기반으로 입력 샘플을 평가하여 관련 없거나 모호한 특성을 거부한다.
- 모델은 Adam 옵timizer를 사용하고 검증 세트를 통한 하이퍼파라미터 튜닝을 통해 스코어 기반 및 거리 기반 두 가지 손실 함수를 동시에 최적화하여 엔드 투 엔드로 학습한다.
- 특성 공학은 깊이 있는 신경망 구조를 통해 암묵적으로 학습되며, 수동적인 특성 선택이나 전처리가 필요 없어진다.
- 단일 통합 모델 내에서 특성 추출, 선택, 분류를 동시에 수행함으로써 오류 전파를 줄이고 비선형 관계 모델링 능력을 향상시킨다.
- μ=0.85, λ=0.70, η=0.40, δ=0.30와 같은 하이퍼파라미터는 거부 임계값을 정의하여 강건성과 일반화 능력을 확보하는 데 사용된다.
실험 결과
연구 질문
- RQ1거부 메커니즘을 갖춘 캐스케이드 신경망이 기존의 분할-통합 접근법보다 암호화된 VPN 트래픽 분류에서 뛰어난 성능을 보일 수 있는가?
- RQ2특성 추출과 분류를 동시에 학습하는 엔드 투 엔드 학습 방식이 암호화된 트래픽 분류의 정확도와 일반화 능력 향상에 얼마나 기여하는가?
- RQ3클래스 점수와 클래스 중심에서의 거리 기반 거부 전략이 관련 없거나 모호한 트래픽 특성을 효과적으로 걸러내는가?
- RQ4제안된 방법이 채팅, 이메일, FTP, 스트리밍, VoIP, 암호화된 VPN 트래픽 등 다양한 트래픽 유형에서 높은 성능을 유지하는가?
- RQ5정확도, 정밀도, 재현율, F1 점수 측면에서 제안된 모델의 성능이 최고 수준의 엔드 투 엔드 학습 모델과 비교해 어떻게 나타나는가?
주요 결과
- 제안된 캐스케이드 신경망과 거부 전략은 테스트 정확도 95%를 달성하였으며, 최고 수준의 E2E 모델(86%)보다 8个百分点 높게 성과를 냈다.
- 거리 기반 방법이 가장 높은 성능를 보였으며, VPN 트래픽에 대해 F1 점수 0.93, 정밀도 0.94, 재현율 0.93을 기록하여 강력한 탐지 능력을 입증하였다.
- 모델는 모든 트래픽 유형, 특히 FTP와 VoIP와 같은 도전적인 클래스에서도 높은 정밀도와 재현율을 유지하며 뛰어난 일반화 능력을 보였다.
- 거리 기반 방법이 점수 기반 방법보다 뛰어난 성능를 보였으며, 점수 기반 방법은 오직 90%의 정확도에 머물러 거리 기반 거부 전략의 효과성을 입증하였다.
- 최고 수준의 EE-CNN 모델 대비 재현율 1.4% 향상, F1 점수 0.4% 향상으로 양호한 양성 케이스 탐지 능력을 확보하였다.
- 프레임워크는 비VPN 트래픽을 이메일, 스트리밍 등 애플리케이션 유형으로 분류하는 동시에 암호화된 VPN 트래픽을 식별하는 이중 기능을 성공적으로 수행하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.