Skip to main content
QUICK REVIEW

[논문 리뷰] Bridging the gap to real-world for network intrusion detection systems with data-centric approach

Gustavo de Carvalho Bertoli, Lourenço Alves Pereira|arXiv (Cornell University)|2021. 10. 25.
Network Security and Intrusion Detection참고 문헌 17인용 수 4
한 줄 요약

이 논문은 실시간으로 공개된 MAWILab 정상 트래픽와 Kali Linux 컨테이너를 이용한 가상화된 공격 트래픽을 조합하여 최신 상태이자 레이블이 부여된 네트워크 침입 탐지(NIDS) 데이터셋을 생성하는 데이터 중심 프레임워크를 제안한다. 이 방법은 재현 가능하고 레이블이 부여된 835,941개 패킷의 데이터셋을 생성하며, 이 중 54%는 공격 샘플(22개의 포트 스캐닝 클래스 포함)이고 46%는 정상 트래픽이며, 기계학습 기반 NIDS 연구에서의 데이터셋 노후화 문제와 실제 적용 가능성 격차를 해결한다.

ABSTRACT

Most research using machine learning (ML) for network intrusion detection systems (NIDS) uses well-established datasets such as KDD-CUP99, NSL-KDD, UNSW-NB15, and CICIDS-2017. In this context, the possibilities of machine learning techniques are explored, aiming for metrics improvements compared to the published baselines (model-centric approach). However, those datasets present some limitations as aging that make it unfeasible to transpose those ML-based solutions to real-world applications. This paper presents a systematic data-centric approach to address the current limitations of NIDS research, specifically the datasets. This approach generates NIDS datasets composed of the most recent network traffic and attacks, with the labeling process integrated by design.

연구 동기 및 목표

  • KDD-CUP99 및 CICIDS-2017와 같은 오래된, 노후화된 데이터셋으로 인해 발생하는 NIDS 연구의 핵심 격차를 해소하기 위해 실제 적용 가능성에 한계가 있는 문제를 해결한다.
  • 모델 중심 접근법의 한계를 극복하기 위해 현재 네트워크 트래픽과 진화하는 공격 패tern을 반영하는 지속적인 데이터 기반의 데이터셋 생성으로 초점을 이동시킨다.
  • 실제로 최신 정상 트래픽과 온디맨드 공격 시뮬레이션을 활용한 재현 가능하고 체계적인 레이블이 부여된 NIDS 데이터셋 생성 프레임워크를 개발한다.
  • 개념 드프트를 방지하고 다양한 네트워크 아키텍처에 걸쳐 일반화 능력을 향상시키기 위해 최신 데이터로 지속적인 모델 재학습을 가능하게 한다.
  • 미래 연구와 실제 구현을 지원하기 위해 공개된 오픈소스 파이프라인을 제공하여 레이블이 부여된 NIDS 데이터셋을 생성한다.

제안 방법

  • Kali Linux 컨테이너를 사용하여 클라우드 기반 대상 인스턴스를 대상으로 온디맨드로 재현 가능한 공격 트래픽을 생성한다.
  • 패킷 캡처를 위해 대상 클라우드 인스턴스에서 tcpdump를 사용하는 UDP 기반의 명령 및 제어 메커니즘을 구현하여 공격자 IP 필터링을 통한 정확한 레이블링을 보장한다.
  • 다양한 클라우드 인스턴스에서 수집한 네트워크 트래픽 파일을 공격 유형과 타임스탬프로 레이블링하여 융합하고, 통합된 공격 데이터셋을 형성한다.
  • 실제로 최신 상태인 공개된 MAWILab 트래픽(태평양 횡단 백본에서 매일 15분 간격으로 수집)을 정상 트래픽 소스로 통합한다.
  • MAWILab 데이터를 선별적으로 처리하여 이상 징후가 있거나 의심스러운 패킷을 제거한 후, 클래스 불균형을 줄이기 위해 무작위 샘플링을 적용한다.
  • 가공된 정상 트래픽과 공격 트래픽 데이터셋을 융합하여 41개의 특성(패킷 내재적 및 맥락 인식 특성)을 가진 단일한 정돈되고 레이블이 부여된 데이터셋으로 조합하며, 상태 없는 분석과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1데이터 중심 접근법이 기존 네트워크 트래픽과 진화하는 공격 패턴을 반영하는 최신 상태이자 레이블이 부여된 NIDS 데이터셋을 생성할 수 있는가? 이는 오래된 벤치마크 데이터셋의 한계를 극복할 수 있는가?
  • RQ2레이블이 부여된 공격 트래픽 생성과 실제 정상 네트워크 트래픽을 융합하기 위한 체계적이고 재현 가능한 파이프라인을 어떻게 설계할 수 있는가?
  • RQ3제안된 프레임워크는 지속적인 데이터셋 생성과 모델 재학습을 통해 NIDS에서의 개념 드프트 문제를 어느 정도 해결할 수 있는가?
  • RQ4실제로 최신 정상 트래픽(MAWILab)과 합성 공격 트래픽을 융합함으로써 데이터셋의 현실성과 일반화 가능성은 어떻게 향상되는가?
  • RQ5통제된 샘플링과 레이블링은 불균형한 NIDS 데이터셋에서 클래스 분포와 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 프레임워크는 835,941개 패킷으로 구성된 레이블이 부여된 NIDS 데이터셋을 성공적으로 생성하였으며, 이 중 54%는 공격(22개의 포트 스캐닝 클래스 포함)으로 분류되고 46%는 정상 트래픽이다.
  • 공격 데이터셋은 4개의 클라우드 기반 인스턴스를 대상으로 한 22개의 서로 다른 TCP 포트 스캐닝 기법으로부터 유래한 455,503개의 레이블이 부여된 샘플로 구성되어 있다.
  • 정상 데이터셋은 2020년 11월 10일과 11월 29일에 수집된 MAWILab 트레이스에서 이상 징후나 의심스러운 트래픽를 제거한 후 유도된 것으로, 380,438개의 정상 샘플로 구성되어 있다.
  • 최종 데이터셋은 무작위 샘플링을 통해 균형을 맞추어 클래스 불균형을 완화하기 위해 통제된 46% 정상/54% 공격 분포를 달성하였다.
  • 데이터셋은 패킷 내재적 특성과 맥락 인식 특성을 융합한 41개의 특성을 포함하며, 상태 없는 NIDS 분석에 적합하다.
  • 공격 생성 및 데이터 수집을 포함한 전체 파이프라인은 재현 가능하며, AB-TRAP GitHub 리포지토리에서 공개되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.