Skip to main content
QUICK REVIEW

[논문 리뷰] Attack vs Benign Network Intrusion Traffic Classification

M. Andrecut|arXiv (Cornell University)|2022. 05. 15.
Network Security and Intrusion Detection인용 수 6
한 줄 요약

이 논문은 CSE-CIC-IDS2018 데이터셋에서 단순한 k-최근접 이웃(k-NN) 분류기가 침입 탐지 분야에서 최신 기술 수준에 근접한 성능을 달성함을 보여주며, 복잡한 딥러닝 모델보다 정확도, F-측정치, 재현율에서 유사하거나 뛰어난 성능을 보이며, 특히 데이터 불균형 상황에서도 모델 학습, 하이퍼파rameter 튜닝, 과적합 위험 없이도 성능을 유지한다.

ABSTRACT

Intrusion detection systems (IDS) are used to monitor networks or systems for attack activity or policy violations. Such a system should be able to successfully identify anomalous deviations from normal traffic behavior. Here we discuss the machine learning approach to building an anomaly-based IDS using the CSE-CIC-IDS2018 dataset. Since the publication of this dataset a relatively large number of papers have been published, most of them presenting IDS architectures and results based on complex machine learning methods, like deep neural networks, gradient boosting classifiers, or hidden Markov models. Here we show that similar results can be obtained using a very simple nearest neighbor classification approach, avoiding the inherent complications of training such complex models. The advantages of the nearest neighbor algorithm are: (1) it is very simple to implement; (2) it is extremely robust; (3) it has no parameters, and therefore it cannot overfit the data. This result also shows that currently there is a trend of developing over-engineered solutions in the machine learning community. Such solutions are based on complex methods, like deep learning neural networks, without even considering baseline solutions corresponding to simple, but efficient methods.

연구 동기 및 목표

  • CSE-CIC-IDS2018 데이터셋을 사용하여 단순한 비모수적 기계학습 방법이 복잡한 딥러닝 모델의 성능을 따라잡을 수 있는지 평가하는 것.
  • 딥러닝 모델에 대한 과도한 설계 경향을 도전하기 위해, k-NN와 같은 기초 모델이 충분하고 더 강건할 수 있음을 보여주는 것.
  • 네트워크 침입 탐지에서 딥러닝 모델이 초래하는 과적합 위험과 과도한 계산 비용을 부각하는 것.
  • 학습 및 하이퍼파rameter 튜닝이 필요 없는 최소한의 파rameter가 없는 대안을 제공하여 복잡한 모델을 대체하는 것.
  • 이웃 기반 접근 방식이 극도로 불균형한 데이터, 예를 들어 03-01-2018.csv 파일과 같이 유사한 정상 및 공격 트래픽 패턴이 존재하는 경우에도 강력한 성능을 유지함을 보여주는 것.

제안 방법

  • 본 연구는 각 테스트 인스턴스에 대해 가장 유사한 학습 샘플을 찾기 위해 내적 유사도를 사용하는 k-최근접 이웃(k-NN) 분류 기반을 채택한다.
  • 각 테스트 샘플에 대해 알고리즘은 테스트 벡터와 모든 학습 벡터 간의 내적을 계산하고, 가장 높은 유사도를 보이는 학습 샘플을 예측 클래스로 선정한다.
  • 방법론은 5개의 폴드로 나누어 각 데이터 파일을 5등분으로 나누고, 각 폴드에서 80%는 학습, 20%는 테스트로 사용하며, 성능 지표를 평균화한다.
  • 분류 이전에 특성 척도 일관성을 확보하기 위해 데이터 정규화를 적용하며, 타임스탬프 및 결측치 포함 열은 제거한다.
  • 정확도, 정밀도, 재현율, F-측정치와 같은 표준 지표를 사용하여 성능을 평가하며, 이는 모든 5개 폴드 반복 평균을 취한다.
  • 이 방법은 학습이 필요 없고, 하이퍼파rameter 튜닝이 불필요하며, 학습 가능한 파rameter가 없기 때문에 과적합의 위험이 없다.

실험 결과

연구 질문

  • RQ1간단하고 비모수적인 최근접 이웃 분류기가 CSE-CIC-IDS2018 침입 탐지 데이터셋에서 복잡한 딥러닝 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2k-NN에서 모델 학습과 하이퍼파rameter 튜닝이 없음으로 인해 딥러닝 방법에 비해 더 나은 일반화 및 강건성을 보이는가?
  • RQ3k-NN는 03-01-2018.csv와 같이 정상 트래픽와 공격 트래픽 패턴이 매우 유사한 극도로 불균형한 데이터에서 어떻게 성능을 발휘하는가?
  • RQ4왜 일부 데이터 파일에서는 딥러닝 모델이 높은 정확도를 보이지만 F-측정치와 재현율이 낮은가? k-NN는 이 문제를 어떻게 완화하는가?
  • RQ5단순한 대안이 뚜렷한 성능을 보이고 있음에도 불구하고, 침입 탐지 분야에서 복잡한 딥러닝 모델로의 추세가 얼마나 정당한가?

주요 결과

  • k-NN 분류기는 전체 데이터 파일에 걸쳐 평균 정확도 98.58%와 F-측정치 96.67%를 기록하여 CSE-CIC-IDS2018 데이터셋에서 강력한 일반화 능력을 보였다.
  • 02-14-2018.csv 및 03-02-2018.csv와 같은 대부분의 데이터 파일에서 k-NN는 정확도(0.9999)와 F-측정치(0.9999)가 거의 완벽했으며, F-측정치와 재현율에서 딥러닝 모델을 능가했다.
  • 03-01-2018.csv 파일에서는 딥러닝 모델이 F-측정치가 낮게(0.34–0.49) 보고되었지만, k-NN는 재현율 0.4227과 F-측정치 0.4564를 기록하여 이 어려운 케이스에서 최고의 딥러닝 모델(0.4852)보다 뚜렷이 뛰어난 성능을 보였다.
  • k-NN는 02-14-2018.csv와 02-16-2018.csv에서 100%의 재현율을 기록하여 해당 파일 내 모든 공격 인스턴스를 효과적으로 탐지함을 나타냈다.
  • k-NN는 학습 시간이나 하이퍼파rameter 튜닝이 전혀 필요 없었으며, 반면 딥러닝 모델은 13.5일 이상의 학습 시간이 소요되어 계산 효율성이 뛰어나다는 점을 입증했다.
  • 결과적으로 딥러닝 모델이 03-01-2018.csv 데이터에 대해 과적합되어 있는 것으로 보이며, 높은 정확도를 기록했지만 F-측정치와 재현율이 k-NN에 비해 뚜렷이 낮게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.