Skip to main content
QUICK REVIEW

[논문 리뷰] Packet2Vec: Utilizing Word2Vec for Feature Extraction in Packet Data

Eric Goodman, Chase Zimmerman|arXiv (Cornell University)|2020. 04. 29.
Network Security and Intrusion Detection인용 수 5
한 줄 요약

이 논문은 원시 네트워크 패킷 데이터에서 n-그램의 시퀀스로 간주함으로써 Word2Vec을 적응시켜 자동으로 특징을 추출하는 새로운 방법인 Packet2Vec을 소개한다. 2009년 DARPA 데이터셋에서 악성 트래픽 대 비악성 트래픽 분류 작업에서 높은 성능을 기록하였으며, AUC-ROC는 0.988–0.996, AUC-PR는 0.604–0.667 사이를 기록하여 수동으로 설계된 특징 없이 딥러닝을 활용한 엔드 투 엔드 특징 추출의 가능성을 입증한다.

ABSTRACT

One of deep learning's attractive benefits is the ability to automatically extract relevant features for a target problem from largely raw data, instead of utilizing human engineered and error prone handcrafted features. While deep learning has shown success in fields such as image classification and natural language processing, its application for feature extraction on raw network packet data for intrusion detection is largely unexplored. In this paper we modify a Word2Vec approach, used for text processing, and apply it to packet data for automatic feature extraction. We call this approach Packet2Vec. For the classification task of benign versus malicious traffic on a 2009 DARPA network data set, we obtain an area under the curve (AUC) of the receiver operating characteristic (ROC) between 0.988-0.996 and an AUC of the Precision/Recall curve between 0.604-0.667.

연구 동기 및 목표

  • 수동으로 설계된 특징의 한계를 해결하기 위해, 이는 오류 발생 가능성이 높고 도메인 전문 지식이 필요하다.
  • Word2Vec과 같은 딥러닝 기법이 원시 패킷 데이터에서 직접 의미 있는 특징을 자동으로 추출할 수 있는지 탐색하기 위해.
  • 패킷 콘텐츠에서 엔드 투 엔드 특징 학습을 통해 실제 사이버 위협 탐지에서 높은 분류 성능을 달성할 수 있음을 입증하기 위해.
  • 네트워크 보안 분석에서 전통적인 특징 공학의 대안으로서 확장 가능하고 자동화된 방법을 제공하기 위해.

제안 방법

  • 패킷의 내용에서 바이트 수준의 부분 문자열을 추출하여 각 네트워크 패킷을 n-그램의 시퀀스로 변환하고, IP 및 포트 정보를 제거하여 콘텐츠에 집중한다.
  • 각 빈번한 n-그램에 대해 밀도 높은 벡터 임베딩을 학습하기 위해 Word2Vec을 적용하여 패킷 콘텐츠 내의 의미적 유사성을 포착한다.
  • 공식 v(p) = (1/|p|) * Σ e(t) for all t ∈ p 를 사용하여 패킷 내 모든 n-그램의 임베딩 평균을 통해 고정된 크기의 특징 벡터를 각 패킷에 대해 생성한다.
  • 이후 패킷 수준의 임베딩을 바탕으로 지도 학습 분류기(예: Scikit-learn 사용)를 훈련하여 비악성 대 악성 트래픽의 이진 분류를 수행한다.
  • 성능 향상을 위해 C++로 구현하고, Boost.Python을 통해 파이썬 인터페이스를 노출하며, std::thread를 사용해 병렬 처리를 구현하여 대규모 데이터를 처리한다.
  • 훈련 및 평가 기준으로 2009년 DARPA 네트워크 데이터셋을 사용하며, 558GB 이상의 원시 패킷 데이터를 처리한다.

실험 결과

연구 질문

  • RQ1수동으로 설계된 특징에 의존하지 않고도 Word2Vec이 원시 네트워크 패킷 데이터에서 의미 있는 특징을 효과적으로 추출할 수 있는가?
  • RQ2기존의 특징 기반 접근 방식과 비교해 볼 때, 딥러닝 기반의 특징 추출 방법은 비악성 대 악성 네트워크 트래픽 분류에서 얼마나 잘 성능을 내는가?
  • RQ3IP 및 포트 메타데이터를 무시할 경우 모델이 악성 행동을 탐지하는 능력에 어떤 영향을 미치는가?
  • RQ4대규모 네트워크 트래픽 데이터를 효율적으로 처리할 수 있는 확장 가능하고 엔드 투 엔드 딥러닝 파이프라인을 구축할 수 있는가?
  • RQ5동일한 기준 데이터셋에서 Packet2Vec의 성능은 기존 방법과 비교해 어떻게 되는가?

주요 결과

  • Packet2Vec 모델은 2009년 DARPA 네트워크 데이터셋에서 수신자 작업 특성 곡선 아래 면적(AUC-ROC)이 0.988에서 0.996 사이를 기록하여 비악성과 악성 트래픽 간의 강력한 분류 능력을 보였다.
  • 정밀도-재현율 곡선 아래 면적(AUC)이 0.604에서 0.667 사이를 기록하여 불균형 탐지 시나리오에서도 견고한 성능을 보였다.
  • IP 주소 및 포트와 같은 메타데이터 없이도 도메인 전문 지식이 필요한 특징 공학 없이도 원시 패킷 콘텐츠에서 의미 있는 표현을 성공적으로 학습하였다.
  • C++ 기반의 병렬 처리 구현과 파이썬 통합을 통해 대규모 원시 패킷 데이터 558GB 이상을 처리할 수 있는 확장성 있는 성능을 보였다.
  • 이전 연구와 마찬가지로 동일한 데이터셋을 사용한 결과, 유량 수준의 특징이나 시간적 집계를 사용한 방법과 비교해 평균 정밀도 0.03과 재현율 0.08의 향상을 기록하며 훨씬 높은 탐지 성능을 달성하였다.
  • 결과적으로 딥러닝 기반 기법이 패킷 페이로드에서 직접 관련 있는 특징을 효과적으로 추출할 수 있으며, 침입 탐지에서 수작업 특징 공학에 대한 의존도를 줄일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.