Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time Network Intrusion Detection via Decision Transformers

Jingdi Chen, Hanhan Zhou|arXiv (Cornell University)|2023. 12. 12.
Network Security and Intrusion Detection인용 수 4
한 줄 요약

이 논문은 실시간 네트워크 침입 탐지 프레임워크를 제안하며, 결정 트랜스포머(DT)를 사용해 패킷 시퀀스를 모델링하여 시의적절하고 정확한 위협 탐지 기능을 제공한다. 과거 패킷, 보상, 결정의 궤적에 조건을 두어 DT가 자동으로 향후 탐지 조치를 생성함으로써, 비효율적인 학습 데이터 조건에서도 강화학습 및 시퀀스 모델링 기준선보다 정확도와 시의성 면에서 뛰어나며, 특히 비이상적인 학습 데이터 조건에서 뛰어난 성능을 보인다.

ABSTRACT

Many cybersecurity problems that require real-time decision-making based on temporal observations can be abstracted as a sequence modeling problem, e.g., network intrusion detection from a sequence of arriving packets. Existing approaches like reinforcement learning may not be suitable for such cybersecurity decision problems, since the Markovian property may not necessarily hold and the underlying network states are often not observable. In this paper, we cast the problem of real-time network intrusion detection as casual sequence modeling and draw upon the power of the transformer architecture for real-time decision-making. By conditioning a causal decision transformer on past trajectories, consisting of the rewards, network packets, and detection decisions, our proposed framework will generate future detection decisions to achieve the desired return. It enables decision transformers to be applied to real-time network intrusion detection, as well as a novel tradeoff between the accuracy and timeliness of detection. The proposed solution is evaluated on public network intrusion detection datasets and outperforms several baseline algorithms using reinforcement learning and sequence modeling, in terms of detection accuracy and timeliness.

연구 동기 및 목표

  • 강화학습 기반 네트워크 침입 탐지에서 마르코프 성질이 자주 실패하고 상태가 관측 불가능한 문제를 해결하기 위해.
  • 완전한 네트워크 플로우가 완료되기 이르기 전 악성 패킷을 조기에 식별함으로써 탐지 시의성을 향상시키기 위해.
  • 오프라인 결정 트랜스포머를 사용해 네트워크 침입 탐지를 시퀀스 모델링 문제로 재정의하여 확장 가능하고 실시간 의사결정을 가능하게 하기 위해.
  • 지연된 결정에 대해 보상 함수를 통해 보상함으로써 정확도와 시의성 사이의 새로운 트레이드오���을 도입하기 위해.
  • 오토에인코더를 통한 패킷 임베딩을 활용하고 다양한 데이터 품질 조건 하에서 성능을 평가함으로써 모델 강인성을 향상시키기 위해.

제안 방법

  • 프레임워크는 과거 패킷, 탐지 결정, 보상의 궤적을 입력으로 사용해 네트워크 침입 탐지를 시퀀스 모델링 문제로 모델링한다.
  • 인과적 마스크가 적용된 결정 트랜스포머(DT)는 희망하는 수익과 이전 관측치에 조건을 두고 자동으로 향후 탐지 결정을 생성한다.
  • 변동 길이의 패킷 시퀀스를 효율적으로 처리하기 위해 사전 학습된 오토에인코더를 사용해 패킷 수준의 특징을 압축된 임베딩으로 변환한다.
  • 지연된 탐지를 방지하기 위해 보상 함수를 설계하여 더 빠르면서도 정확한 결정을 유도함으로써 속도와 정밀도 사이의 트레이드오프를 가능하게 한다.
  • 모델은 UNSW-NB15 데이터셋에서의 과거 궤적을 오프라인으로 학습하며, 악성 트래픽에 대해 오버샘플링을 사용한 균형 잡힌 데이터셋을 평가에 활용한다.
  • 이 접근법은 아키텍처에 종속되지 않아 LSTMs나 TCNs와 같은 다른 모델과의 통합이 가능하지만, 주요 평가에는 트랜스포머를 사용한다.

실험 결과

연구 질문

  • RQ1결정 트랜스포머는 마르코프 성질에 의존하지 않고도 실시간 침입 탐지에 적합한 순차적 네트워크 트래픽을 효과적으로 모델링할 수 있는가?
  • RQ2기존의 강화학습 및 지도학습 기반 기준선과 비교해 제안된 프레임워크는 정확도와 시의성 사이에서 어떻게 균형을 이루는가?
  • RQ3부적절하거나 비전문가 행동 정책에 기반한 행동을 학습할 경우 모델의 일반화 능력과 성능 유지 능력은 어느 정도인가?
  • RQ4패킷 임베딩과 지연에 대한 보상을 부여하는 보상 함수의 사용은 탐지 속도와 정확도에 어떤 영향을 미치는가?
  • RQ5제한적 또는 불균형한 학습 데이터 조건에서도 이 프레임워크는 높은 탐지 성능을 달성할 수 있는가?

주요 결과

  • 제안된 DT 기반 방법은 랜덤 샘플링 조건에서도 하위 최적의 학습 데이터 조건 하에서 F1 스코어 0.91 이상을 달성하며 모든 기준선을 능가하는 정확도를 보였다.
  • 전문가 샘플링 조건에서는 DT가 정밀도 0.99를 기록했으며, CQL보다 더 낮은 TTR(Time To Resolution)를 기록하여 정확도를 희생시키지 않고도 더 빠른 탐지가 가능했다.
  • 중간 수준의 샘플링 조건에서는 DT가 BC의 TTR 0.80을 그대로 유지했지만, 보다 높은 보상과 탐지 정확도를 기록하여 훨씬 뛰어난 강인성을 입증했다.
  • 모든 설정에서 가장 낮은 TTR를 유지하면서도 높은 정밀도와 재현율을 확보함으로써 위협 탐지의 가속화 효과를 입증했다.
  • 보상 함수는 조기에 탐지하도록 효과적으로 유도하여, 기준선 대비 더 높은 정규화된 보상 스코어(전문가 정책에 가까운 값)를 기록했다.
  • 비이상적인 데이터 조건 하에서도 강력한 일반화 능력을 보이며, 고급 행동 데이터가 부족한 실세계 환경에 적합한 실시간 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.