Skip to main content
QUICK REVIEW

[논문 리뷰] TEST: an End-to-End Network Traffic Examination and Identification Framework Based on Spatio-Temporal Features Extraction

Yi Zeng, Zihao Qi|arXiv (Cornell University)|2019. 08. 26.
Internet Traffic Analysis and Secure E-voting참고 문헌 19인용 수 9
한 줄 요약

이 논문은 원시 네트워크 트래픽에서 공간적(컨볼루션 네트워크를 통해) 및 시간적(장기 단기 기억 네트워크를 통해) 특징을 동시에 추출하는 딥러닝 기반 엔드 투 엔드 프레임워크인 TEST를 제안한다. 이는 암호화된 트래픽 분류와 침입 탐지에 높은 정확도를 가능하게 한다. 균형 잡힌 데이터셋을 사용한 3층 계층적 구조를 통해 TEST는 8개 클래스로 구성된 트래픽 데이터셋에서 최신 기술 수준의 정확도 99.98%를 달성하였으며, 공간적 또는 시간적 특징만을 사용하는 모델들보다 뛰어난 성능을 보였다.

ABSTRACT

With more encrypted network traffic gets involved in the Internet, how to effectively identify network traffic has become a top priority in the field. Accurate identification of the network traffic is the footstone of basic network services, say QoE, bandwidth allocation, and IDS. Previous identification methods either cannot deal with encrypted traffics or require experts to select tons of features to attain a relatively decent accuracy.In this paper, we present a Deep Learning based end-to-end network traffic identification framework, termed TEST, to avoid the aforementioned problems. CNN and LSTM are combined and implemented to help the machine automatically extract features from both special and time-related features of the raw traffic. The presented framework has two layers of structure, which made it possible to attain a remarkable accuracy on both encrypted traffic classification and intrusion detection tasks. The experimental results demonstrate that our model can outperform previous methods with a state-of-the-art accuracy of 99.98%.

연구 동기 및 목표

  • 점점 증가하는 암호화 및 프라이버시 보호 프로토콜에 대비하여 암호화된 트래픽과 악성 트래픽을 정확하게 분류하는 데 도전하는 것.
  • 수동적인 특징 엔지니어링에 의존하거나 암호화된 트래픽에서는 효과가 떨어지는 전통적 방법의 한계를 극복하는 것.
  • 전문가가 선택한 특징이 필요로 하거나 비밀 정보를暴露하지 않는 방식으로 원시 트래픽에서 자동으로 학습하는 엔드 투 엔드 딥러닝 프레임워크를 개발하는 것.
  • CNN와 LSTM을 계층적이고 균형 잡힌 학습 프레임워크에서 공간적 및 시간적 트래픽 패턴을 함께 모델링하여 분류의 강건성과 정확도를 향상시키는 것.

제안 방법

  • 프레임워크는 세 가지 계층적 구조를 사용한다: 전처리 계층(P-계층), 일반 분류 계층(G-계층), 전문화된 동작 계층(S-계층)으로 모듈화된 균형 잡힌 학습을 가능하게 한다.
  • 공간적 특징은 원시 트래픽 플로우 데이터로부터 컨볼루션 신경망(CNN)을 사용해 추출되며, 패킷 시퀀스의 구조적 패턴을 캡처한다.
  • 시간적 특징은 장기 단기 기억(LSTM) 네트워크를 통해 캡처되며, 플로우 간격 간의 시계열 의존성을 모델링한다.
  • 각 분류 계층은 정교하게 설계된 균형 잡힌 데이터셋을 기반으로 학습되어 모든 트래픽 클래스에서 높고 안정적인 성능을 확보한다.
  • CNN과 LSTM의 통합은 네트워크 트래픽의 공간적 및 시간적 차원에서의 공동 학습을 가능하게 하여 특징 표현을 향상시킨다.
  • 엔드 투 엔드 설계는 수동적인 특징 선택이 필요 없고, 원시 트래픽 입력에서 직접 작동함으로써 프라이버시를 보호한다.

실험 결과

연구 질문

  • RQ1원시 네트워크 트래픽에서 공간적 및 시간적 특징을 동시에 모델링하는 딥러닝 프레임워크가 단일 모odal을 사용하는 모델보다 뛰어난 분류 정확도를 달성할 수 있는가?
  • RQ2계층적 프레임워크에서 균형 잡힌 데이터셋을 사용할 경우, 다양한 트래픽 유형 간의 트래픽 분류의 강건성과 정확도에 어떤 영향을 미치는가?
  • RQ3엔드 투 엔드 딥러닝 모델이 수동으로 엔지니어링된 특징이나 프로토콜 수준의 검사 없이 암호화된 트래픽과 악성 트래픽을 얼마나 잘 식별할 수 있는가?
  • RQ4다층 아키텍처에서 CNN과 LSTM을 통합함으로써 실제 네트워크 트래픽 분류 작업에서 성능 향상이 상당히 향상되는가?

주요 결과

  • TEST는 8종류의 서로 다른 네트워크 트래픽을 분류하는 데 최신 기술 수준의 정확도 99.98%를 달성하였으며, 기준 모델들보다 뚜렷이 뛰어난 성능을 보였다.
  • 프레임워크 내 CNN과 LSTM의 조합은 LeNet(80.27%) 대비 19.71% 향상된 성능과 3층 LSTM(81.96%) 대비 17.92% 향상된 성능을 기록하였다.
  • TEST는 뛰어난 강건성을 보였으며, 대부분의 트래픽 클래스에서 F1 스코어가 1.0이었고, 특히 채팅, 이메일, 파일 전송 트래픽 분류에서 뛰어난 성능를 보였다.
  • TEST의 평균 F1 스코어(0.999)는 LeNet(0.851)과 LSTM(0.864)보다 뚜렷이 높아, 향상된 안정성과 성능를 확인시켰다.
  • 결과는 공간적 및 시간적 특징을 동시에 활용할 경우, 단일 모달을 사용하는 것보다 훨씬 뛰어난 분류 성능를 달성할 수 있음을 확인하였다.
  • 프레임워크는 암호화되지 않은 트래픽과 악성 트래픽 모두에서 뛰어난 성능를 보였지만, 특히 암호화된 트래픽에서 성능 향상이 더 두드러져, 공동 특징 학습의 가치를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.