Skip to main content
QUICK REVIEW

[논문 리뷰] IGRF-RFE: A Hybrid Feature Selection Method for MLP-based Network Intrusion Detection on UNSW-NB15 Dataset

Yuhua Yin, Julian Jang‐Jaccard|arXiv (Cornell University)|2022. 03. 30.
Network Security and Intrusion Detection인용 수 14
한 줄 요약

이 논문은 UNSW-NB15 데이터셋에서 MLP 기반 네트워크 침입 탐지에 대해 정보 이득(IG)과 랜덤 포레스트(RF) 필터 방법을 조합한 하이브리드 특성 선택 방법인 IGRF-RFE를 제안한다. 이는 RFE를 워퍼로 사용하여 특성 수를 42개에서 23개로 감소시키며, MLP 분류 정확도를 82.25%에서 84.24%로 향상시키고 F1 스코어를 82.85%로 개선했다.

ABSTRACT

The effectiveness of machine learning models is significantly affected by the size of the dataset and the quality of features as redundant and irrelevant features can radically degrade the performance. This paper proposes IGRF-RFE: a hybrid feature selection method tasked for multi-class network anomalies using a Multilayer perceptron (MLP) network. IGRF-RFE can be considered as a feature reduction technique based on both the filter feature selection method and the wrapper feature selection method. In our proposed method, we use the filter feature selection method, which is the combination of Information Gain and Random Forest Importance, to reduce the feature subset search space. Then, we apply recursive feature elimination(RFE) as a wrapper feature selection method to further eliminate redundant features recursively on the reduced feature subsets. Our experimental results obtained based on the UNSW-NB15 dataset confirm that our proposed method can improve the accuracy of anomaly detection while reducing the feature dimension. The results show that the feature dimension is reduced from 42 to 23 while the multi-classification accuracy of MLP is improved from 82.25% to 84.24%.

연구 동기 및 목표

  • 고차원 네트워크 데이터셋에서의 부적절하고 중복된 특성으로 인한 MLP 기반 침입 탐지 성능 저하 문제를 해결하기 위해.
  • 특성 선택을 통해 다중 클래스 네트워크 이상 탐지의 정확도를 향상시키고 가짜 경고 수를 줄이기 위해.
  • 필터 방법의 빠른 처리 속도와 워퍼 방법의 관련성 인식 최적화를 결합한 하이브리드 특성 선택 접근법을 개발하기 위해.
  • 실제 데이터 분할 조건을 반영한 표준 UNSW-NB15 데이터셋에서 제안된 방법의 효과성을 검증하기 위해.

제안 방법

  • 첫 번째 단계에서는 정보 이득(IG)과 랜덤 포레스트(RF)를 모두 활용한 하이브리드 필터 방법을 적용하여 특성 중요도 기반으로 초기 특성 집합을 순위 매기고 감소시킨다.
  • IG와 RF에서 상위 특성의 교집합을 이용해 보다 정제된 특성 하위집합을 구성하여, 단독으로 IG에 의해 선택되는 빈도가 높지만 영향력이 낮은 특성의 영향을 최소화한다.
  • 두 번째 단계에서는 MLP 분류기를 워퍼로 사용한 순환적 특성 제거(RFE)를 적용하여 덜 관련성이 높은 특성을 반복적으로 제거하고 최적의 특성 하위집합을 식별한다.
  • 계산 비용을 줄이기 위해 성능 저하 없이 성능을 유지할 수 있도록 조기 종료를 허용하는 환경 설정 매개변수(p)를 도입한다.
  • 범주형 특성은 유지하고 선택된 수치형 특성과 조합하여 최종 특성 하위집합을 구성한다.
  • 최종 특성 하위집합을 사용해 MLP 모델을 훈련시키며, 정확도, F1 스코어, 정밀도, 재현율과 같은 다중 클래스 분류 평가 지표를 통해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1하이브리드 필터-워퍼 특성 선택 방법이 UNSW-NB15 데이터셋에서 MLP 기반 네트워크 침입 탐지 성능을 향상시킬 수 있는가?
  • RQ2IG와 RF 필터 방법을 조합함으로써 단독으로 사용할 경우보다 특성의 관련성은 어떻게 향상되는가?
  • RQ3초기 필터 기반 감소 이후 RFE 기반 워퍼 선택이 분류 정확도에 얼마나 기여하는가?
  • RQ4제안된 IGRF-RFE 방법이 동일한 데이터셋과 모델에서 단독으로 사용된 IG, RF 또는 기타 기존 특성 선택 기법보다 우월한가?
  • RQ5MLP를 사용한 고성능 다중 클래스 네트워크 이상 탐지에 필요한 최적의 특성 수는 얼마인가?

주요 결과

  • IGRF-RFE는 특성 수를 42개에서 23개로 감소시켜 다중 클래스 분류 정확도를 82.25%에서 84.24%로 크게 향상시켰다.
  • 이 방법은 가중치 F1 스코어 82.85%를 달성하여 단독으로 사용된 IG(81.49%) 및 RF(81.62%) 특성 선택 방법보다 뛰어난 성능을 보였다.
  • 필터 단계에서 IG와 RF를 조합함으로써, 단독으로 IG에 의해 과다 선택되는 빈도는 높지만 영향력이 낮은 특성의 문제를 효과적으로 완화했다.
  • XGBoost, WFEU, DT 기반 방법을 사용한 유사한 기존 연구들보다 IGRF-RFE가 더 뛰어난 성능을 보였다.
  • 특정 모델이 더 높은 정확도(예: 95.2%)를 달성하더라도 상당히 더 큰 또는 다른 방식으로 분할된 데이터셋을 사용하는 경우에도 IGRF-RFE는 강건성과 경쟁력을 입증했다.
  • IGRF-RFE의 계산 복잡도는 표준 RFE와 동일한 O(n²)를 유지하며, 환경 설정 매개변수를 통한 조기 종료로 자원 효율성을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.