[논문 리뷰] Evaluating Standard Feature Sets Towards Increased Generalisability and Explainability of ML-based Network Intrusion Detection
이 논문은 세 가지 벤치마크 데이터셋(CSE-CIC-IDS2018, ToN-IoT, BoT-IoT)에서 NetFlow와 CICFlowMeter 기능 집합을 비교함으로써 기계학습 기반 네트워크 침입 탐지 시스템의 일반화 능력과 해석 가능성성을 평가한다. 랜덤 포레스트와 딥 피드포워드 분류기 모델을 사용하여 NetFlow 기능 집합이 탐지 정확도와 추론 속도 측면에서 CICFlowMeter보다 일관되게 뛰어나다는 것을 입증한다. 또한 SHAP 분석을 통해 공격 탐지에 가장 영향을 미치는 요소로 전방 방향 기능과 IAT 기반 기능이 확인되었으며, 이는 모든 데이터셋에서 공통으로 나타났다.
Machine Learning (ML)-based network intrusion detection systems bring many benefits for enhancing the cybersecurity posture of an organisation. Many systems have been designed and developed in the research community, often achieving a close to perfect detection rate when evaluated using synthetic datasets. However, the high number of academic research has not often translated into practical deployments. There are several causes contributing towards the wide gap between research and production, such as the limited ability of comprehensive evaluation of ML models and lack of understanding of internal ML operations. This paper tightens the gap by evaluating the generalisability of a common feature set to different network environments and attack scenarios. Therefore, two feature sets (NetFlow and CICFlowMeter) have been evaluated in terms of detection accuracy across three key datasets, i.e., CSE-CIC-IDS2018, BoT-IoT, and ToN-IoT. The results show the superiority of the NetFlow feature set in enhancing the ML models detection accuracy of various network attacks. In addition, due to the complexity of the learning models, SHapley Additive exPlanations (SHAP), an explainable AI methodology, has been adopted to explain and interpret the classification decisions of ML models. The Shapley values of two common feature sets have been analysed across multiple datasets to determine the influence contributed by each feature towards the final ML prediction.
연구 동기 및 목표
- 기계학습 기반 네트워크 침입 탐지 시스템(NIDS)의 학술 연구와 실세계 구현 간 격차를 해소하기 위해.
- 다양한 네트워크 환경와 공격 시나리오에서 표준 기능 집합인 NetFlow와 CICFlowMeter의 일반화 능력을 평가하기 위해.
- 기계학습 예측에서 기능 기여도를 해석하기 위해 Shapley Additive exPlanations(SHAP)를 적용하여 모델의 설명 가능성을 향상시키기 위해.
- 표준화된, 교차 데이터셋 평가를 가능하게 하기 위해 두 가지 새로운 CICFlowMeter 형식의 데이터셋(CIC-BoT-IoT 및 CIC-ToN-IoT)을 생성하고 공개하기 위해.
제안 방법
- ToN-IoT와 BoT-IoT를 CICFlowMeter 기능 형식으로 변환하여 CIC-BoT-IoT와 CIC-ToN-IoT라는 두 가지 새로운 데이터셋을 구축함으로써 일관된 평가를 가능하게 하였다.
- 모든 세 데이터셋에서 NetFlow와 CICFlowMeter 기능 집합을 사용하여 랜덤 포레스트(RF) 및 딥 피드포워드(DFF) 기계학습 모델을 적용하여 네트워크 트래픽을 분류하였다.
- 모델 결정을 해석하기 위해 Shapley Additive exPlanations(SHAP)를 사용하였으며, DFF 모델에는 KernelSHAP, RF 모델에는 TreeSHAP를 적용하였다.
- 테스트 샘플의 평균 SHAP 값에 대해 정규화하고, 기능 영향력 순위를 시각화하여 다양한 데이터셋과 모델 간의 영향력 비교를 수행하였다.
- 다양한 기능 집합에서의 탐지 정확도와 추론 시간을 평가하여 모델 성능과 효율성을 분석하였다.
- 모든 데이터셋과 기능 집합을 공개하여 기계학습 기반 NIDS의 재현 가능하고 교차 데이터셋 기반의 벤치마킹을 가능하게 하였다.

실험 결과
연구 질문
- RQ1다양한 네트워크 환경와 공격 유형에서 NetFlow 기능 집합이 CICFlowMeter 기능 집합보다 더 잘 일반화되는가?
- RQ2다양한 기계학습 모델(RF 및 DFF)을 사용할 때 NetFlow와 CICFlowMeter의 탐지 정확도와 추론 시간은 어떻게 비교되는가?
- RQ3SHAP 분석을 통해 여러 데이터셋에서 기계학습 모델 예측에 가장 크게 기여하는 네트워크 기능은 무엇인가?
- RQ4기능 중요도 순위는 데이터셋 간에 얼마나 다를 수 있으며, 다양한 공격 시나리오에서 일관되게 높은 영향력을 가진 기능은 존재하는가?
주요 결과
- 랜덤 포레스트(RF) 및 딥 피드포워드(DFF) 분류기 모두에서 NetFlow 기능 집합이 CSE-CIC-IDS2018, ToN-IoT, BoT-IoT 세 데이터셋 전반에서 CICFlowMeter보다 높은 탐지 정확도를 기록하였다.
- NetFlow 기반 모델은 더 낮은 예측 시간을 보였으며, 이는 실시간 구현 환경에서의 더 높은 효율성을 시사한다.
- CICFlowMeter 기반 CIC-BoT-IoT 데이터셋에서 RF 및 DFF 모델 모두에서 전방 방향 기능(Fwd IAT Min, Fwd IAT Mean 등)이 상위 5개 영향력 기능에 포함되었다.
- RF 분류기에서는 CICFlowMeter 형식에서 전방 방향 기능과 IAT 기반 기능이 가장 큰 영향을 미쳤으며, NetFlow 기능은 다양한 모델 간에 더 높은 일관성을 보였다.
- NetFlow 기반 기능은 RF 및 DFF 모델 모두에서 상위 10개 영향력 기능 중 5개가 공통으로 나타났고, CICFlowMeter는 이와 비교해 단지 2개에 그쳤다. 이는 NetFlow 기능이 더 높은 안정성과 일반화 능력을 지녔음을 시사한다.
- SHAP 분석을 통해 데이터셋 간 기능 중요도에 상당한 변동성이 있음을 확인하였으며, 이는 기능의 영향력이 특정 공격 유형과 정상 트래픽 패턴에 매우 의존적임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.