[논문 리뷰] Evaluation of Machine Learning Algorithms in Network-Based Intrusion Detection System
이 논문은 기존 데이터셋으로 훈련하고 이후 시점의 시간적으로 별개의 데이터셋으로 테스트하여 장기 성능를 평가하고 과적합 여부를 탐지함으로써 기계학습 기반 네트워크 침입 탐지 시스템(ML-NIDS)에 대한 새로운 평가 방법을 제안한다. 연구 결과, SVM과 ANN가 과적합에 가장 강건한 것으로 나타났으며, DT와 RF는 높은 훈련 성능를 보였음에도 불구하고 심각한 과적합을 보였다. 이는 실제 환경에서의 평가 시 시간적 데이터 분리의 중요성을 강조한다.
Cybersecurity has become one of the focuses of organisations. The number of cyberattacks keeps increasing as Internet usage continues to grow. An intrusion detection system (IDS) is an alarm system that helps to detect cyberattacks. As new types of cyberattacks continue to emerge, researchers focus on developing machine learning (ML) based IDS to detect zero-day attacks. Researchers usually remove some or all attack samples from the training dataset and only include them in the testing dataset when evaluating the performance of an IDS on detecting zero-day attacks. Although this method may show the ability of an IDs to detect unknown attacks; however, it does not reflect the long-term performance of the IDS as it only shows the changes in the type of attacks. In this paper, we focus on evaluating the long-term performance of ML based IDS. To achieve this goal, we propose evaluating the ML-based IDS using a dataset that is created later than the training dataset. The proposed method can better assess the long-term performance of an ML-based IDS, as the testing dataset reflects the changes in the type of attack and the changes in network infrastructure over time. We have implemented six of the most popular ML models that are used for IDS, including decision tree (DT), random forest (RF), support vector machine (SVM), naïve Bayes (NB), artificial neural network (ANN) and deep neural network (DNN). Our experiments using the CIC-IDS2017 and the CSE-CIC-IDS2018 datasets show that SVM and ANN are most resistant to overfitting. Besides that, our experiment results also show that DT and RF suffer the most from overfitting, although they perform well on the training dataset. On the other hand, our experiments using the LUFlow dataset have shown that all models can perform well when the difference between the training and testing datasets is small.
연구 동기 및 목표
- 훈련 및 테스트에 동일한 데이터셋을 사용하는 기존 ML-NIDS 평가 방식의 한계를 해결하기 위해, 이는 실제 장기 성능를 반영하지 못함.
- 훈련 기간 이후에 수집된 데이터로 평가할 때 기계학습 모델이 네트워크 기반 침입 탐지 시스템에서 어떻게 성능를 발휘하는지 평가함으로써 실제 환경의 시간적 변화를 시뮬레이션함.
- 진화하는 네트워크 트래픽과 공격 패tern에 직면했을 때 과적합에 가장 강건한 기계학습 모델을 특정함.
- 시간적으로 분리된 데이터셋(예: CIC-IDS2017을 훈련용, CSE-CIC-IDS2018을 테스트용으로 사용)을 활용하는 새로운 평가 방법론을 제안하고 검증함으로써 실제 배포 조건을 더 잘 반영함.
- 조직의 위협 프로파일과 인프라 안정성에 기반한 모델 선택에 실질적 지침을 제공함.
제안 방법
- 저자들은 기존 데이터셋(예: CIC-IDS2017)으로 여섯 가지 기계학습 모델(DT, RF, SVM, NB, ANN, DNN)을 훈련하고, 이후 시점의 시간적으로 별개의 데이터셋(예: CSE-CIC-IDS2018)으로 성능를 평가함으로써 실제 환경 배포를 시뮬레이션함.
- 평가에는 CIC-IDS2017과 CSE-CIC-IDS2018이라는 두 가지 주요 데이터셋을 사용함. 이 두 데이터셋은 네트워크 아키텍처, 공격 유형, 클래스 분포에서 상당한 차이를 보이며, 이는 테스트 시나리오의 현실성과 강도를 높임.
- 두 번째 평가는 네트워크 환경 변화가 최소한인 6개월 간격으로 수집된 LUFlow 데이터셋(2020년 7월 대비 2021년 1월)을 사용하여, 환경 변화 최소화 조건에서의 성능를 평가함.
- 모델 성능는 정확도, 정밀도, 재현율, F1 점수 등의 표준 지표를 사용해 측정하며, 훈련 및 테스트 세트 간 성능 저하를 통해 과적합 여부를 탐지하는 데 중점을 둠.
- 시간적 및 환경적 이격 정도가 다른 데이터셋 간 모델 행동을 비교함으로써 모델의 강건성 평가함.
- 특징 선택이 데이터셋에 적용되었지만, 논문은 특징 선택 최적화를 추가로 수행할 경우 모델 일반화 성능 향상이 가능할 수 있음을 언급함.
실험 결과
연구 질문
- RQ1훈련 데이터셋 이후에 수집된 데이터셋으로 평가할 때, 다양한 기계학습 모델은 네트워크 트래픽과 공격 패턴의 실제 시간적 변화를 반영하여 어떻게 성능를 발휘하는가?
- RQ2후행 별개 데이터셋으로 테스트했을 때 과적합에 가장 강건한 기계학습 모델은 무엇이며, 이는 장기 일반화 성능가 높음을 시사하는가?
- RQ3훈련 및 테스트 데이터셋 간 성능 격차는 과적합을 얼마나 잘 드러내며, 이는 모델 강건성의 신뢰할 수 있는 지표로 활용될 수 있는가?
- RQ4공격 유형과 네트워크 인프라에서 상당한 차이를 보이는 훈련 및 테스트 데이터셋을 선택할 경우, 모델의 일반화 능력은 어떻게 영향을 받는가?
- RQ5다른 위협 프로파일과 인프라 업데이트 빈도를 가진 조직에 있어서 모델 선택의 실질적 영향은 무엇인가?
주요 결과
- SVM과 ANN는 후행 데이터셋으로 평가했을 때 과적합에 가장 강건한 것으로 나타나, 뛰어난 장기 일반화 성능를 보임.
- 결정트리(DT)와 랜덤 포레스트(RF) 모델은 심각한 과적합을 보였으며, 훈련 세트에선 높은 정확도를 기록했지만 테스트 세트에선 80% 이하로 떨어졌으며, 이는 침입 탐지 시스템에 있어 수용 불가능한 수준임.
- CIC-IDS2017에서 CSE-CIC-IDS2018로의 전이 시 훈련 대비 테스트 성능 저하 현상은 오래된 데이터로 훈련된 모델이 새로운 복잡한 공격 패턴과 네트워크 환경에 일반화하지 못함을 시사함.
- 반대로, 환경 변화가 최소한인 LUFlow 데이터셋(6개월 간격)으로 훈련된 모델들은 모든 모델에서 우수한 성능를 보였으며, 이는 시간적 이격 자체가 성능 저하의 유일한 원인이 아님을 시사함.
- 기존의 동일한 데이터셋을 훈련 및 테스트에 사용하는 ML-NIDS 평가 방식은 과적합을 탐지하지 못할 수 있으며, 성능 격차는 후행 데이터셋으로 테스트할 때 비로소 드러남을 확인함.
- ANN는 빈번한 인프라 업데이트와 높은 사이버 공격 위험을 가진 환경에 가장 적합한 모델로 확인되었으며, DT는 효율성과 높은 훈련 성능를 바탕으로 낮은 목표, 안정적인 환경에 더 적합함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.