Skip to main content
QUICK REVIEW

[논문 리뷰] On Generalisability of Machine Learning-based Network Intrusion Detection Systems

Siamak Layeghy, Marius Portmann|arXiv (Cornell University)|2022. 05. 09.
Network Security and Intrusion Detection인용 수 11
한 줄 요약

이 논문은 네 개의 최근에 발표된 기준 데이터셋을 기반으로 기계학습 기반 네트워크 침입 탐지 시스템(NIDS)의 일반화 능력을 조사한다. 연구 결과, 모든 데이터셋 간에 잘 일반화되는 모델은 존재하지 않으며, 일반화 능력은 매우 비대칭적임을 확인했고, 분포 변화가 발생할 경우 특성-클래스 대응 관계가 무너지므로, 비지도 학습 모델이 도메인 간 설정에서 지도 학습 모델보다 성능이 뛰어남을 밝혀냈다.

ABSTRACT

Many of the proposed machine learning (ML) based network intrusion detection systems (NIDSs) achieve near perfect detection performance when evaluated on synthetic benchmark datasets. Though, there is no record of if and how these results generalise to other network scenarios, in particular to real-world networks. In this paper, we investigate the generalisability property of ML-based NIDSs by extensively evaluating seven supervised and unsupervised learning models on four recently published benchmark NIDS datasets. Our investigation indicates that none of the considered models is able to generalise over all studied datasets. Interestingly, our results also indicate that the generalisability has a high degree of asymmetry, i.e., swapping the source and target domains can significantly change the classification performance. Our investigation also indicates that overall, unsupervised learning methods generalise better than supervised learning models in our considered scenarios. Using SHAP values to explain these results indicates that the lack of generalisability is mainly due to the presence of strong correspondence between the values of one or more features and Attack/Benign classes in one dataset-model combination and its absence in other datasets that have different feature distributions.

연구 동기 및 목표

  • 다양한 기준 데이터셋 간 기계학습 기반 NIDS의 일반화 능력을 조사하고, 특히 실제 운영 환경에서의 적용 상황을 고려한다.
  • 표준 기준 데이터셋에서 높은 성능을 보이는 모델이 새로운 네트워크 환경으로도 일반화되는지 여부를 확인한다.
  • 교차 데이터셋 평가에서 지도 학습 모델과 비지도 학습 모델의 성능을 비교한다.
  • SHAP 값(Shapley Additive exPlanations)을 사용하여 다양한 데이터 분포에서의 모델 결정 원인을 분석하고, 일반화 실패의 근본 원인을 규명한다.
  • 학술적 NIDS 연구와 실무 적용 간 격차를 해소하기 위해, 모델 이식성 실패 원인을 진단한다.

제안 방법

  • 연구는 네 개의 최근에 발표된 NetFlow로 변환된 NIDS 데이터셋(모두 동일한 특성 집합을 가짐)을 대상으로, 네 개의 지도 학습 모델과 세 개의 비지도 학습 모델 총 일곱 개의 기계학습 모델을 평가한다.
  • 각 모델은 한 데이터셋에서 학습하고, 네 개의 모든 데이터셋(학습 데이터셋 포함)에서 평가하여 단일 도메인 및 다중 도메인 성능를 비교한다.
  • 일방향(원천 → 대상)과 반대 방향(대상 → 원천)으로 교차 평가를 수행하여 일반화 능력의 비대칭성을 평가한다.
  • 모델 예측을 해석하고 공격 또는 양호 클래스와 강한 관련이 있는 특성을 식별하기 위해 SHAP(Shapley Additive exPlanations) 값을 계산한다.
  • 모든 모델-데이터셋 조합에서 정확도, 탐지율, F1 점수와 같은 표준 지표를 사용해 성능을 측정한다.
  • 일반화 성능를 정량화하기 위해 단일 도메인 평가와 교차 도메인 평가 간 통계적 비교를 수행한다.

실험 결과

연구 질문

  • RQ1기계학습 기반 NIDS 모델이 한 기준 데이터셋에서 학습된 후 다른 기준 데이터셋으로 일반화되는 정도는 어느 정도인가?
  • RQ2원천 데이터셋과 대상 데이터셋을 뒤바꿔도 모델의 일반화 능력이 대칭적인가?
  • RQ3비지도 학습 모델이 다양한 NIDS 데이터셋 간에 지도 학습 모델보다 더 잘 일반화되는가?
  • RQ4다른 데이터 분포 간 일반화 실패를 설명하는 특성 또는 모델 패턴은 무엇인가?
  • RQ5SHAP 값은 단순하고 데이터에 의존하는 결정 규칙이 존재함을 어떻게 드러내며, 이는 도메인 간 이식을 방해하는가?

주요 결과

  • 평가한 일곱 개의 기계학습 모델 중 어느 것도 네 개의 기준 데이터셋 전반에서 잘 일반화되지 않아, 심각한 일반화 갭이 존재함을 확인했다.
  • 일반화 능력은 매우 비대칭적이었으며, 원천과 대상 데이터셋을 바꿀 경우 성능이 크게 떨어져, 모델 이식에 방향성 의존성이 있음을 시사했다.
  • 비지도 학습 모델은 단일 도메인 성능가 낮음에도 불구하고, 교차 데이터셋 평가에서 지도 학습 모델을 능가하는 성능을 보였다.
  • 특정 데이터셋-모델 조합에서의 높은 성능는 주로 간단하고 강력한 특성-클래스 대응 관계(예: MAX_TTL 값이 양호 및 공격 트래픽을 명확히 분리함)에 기인했다.
  • SHAP 분석 결과, 단일 특성 규칙에 의존하는 모델는 목표 데이터셋에서 특성 분포가 변화할 경우 일반화에 실패함을 확인했다.
  • 일반화 실패의 원인은, 동일한 모델과 특성을 사용하더라도 목표 데이터셋에서 일관되고 강력한 특성-클래스 관계가 존재하지 않기 때문임을 규명했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.