Skip to main content
QUICK REVIEW

[논문 리뷰] Building an Effective Intrusion Detection System using Unsupervised Feature Selection in Multi-objective Optimization Framework

Chanchal Suman, Somanath Tripathy|arXiv (Cornell University)|2019. 05. 16.
Network Security and Intrusion Detection참고 문헌 27인용 수 7
한 줄 요약

이 논문은 NSGA-II를 사용하여 상호정보량, 표준편차, 정보량 증가량을 동시에 최적화함으로써 침입 탐지 시스템(IDS)을 위한 비지도 다중목표 특성 선택 프레임워크를 제안한다. 특성 선택 과정에서 레이블 데이터를 사용하지 않아도 KDD-99 데이터셋에서 99.78%의 정확도, 99.27%의 탐지율, 오직 0.2%의 위양성 경고율을 달성하며, 이는 이전 최고 성능 결과를 초월한다.

ABSTRACT

Intrusion Detection Systems (IDS) are developed to protect the network by detecting the attack. The current paper proposes an unsupervised feature selection technique for analyzing the network data. The search capability of the non-dominated sorting genetic algorithm (NSGA-II) has been employed for optimizing three different objective functions utilizing different information theoretic measures including mutual information, standard deviation, and information gain to identify mutually exclusive and a high variant subset of features. Finally, the Pareto optimal front of the different optimal feature subsets are obtained and these feature subsets are utilized for developing classification systems using different popular machine learning models like support vector machines, decision trees and k-nearest neighbour (k=5) classifier etc. We have evaluated the results of the algorithm on KDD-99, NSL-KDD and Kyoto 2006+ datasets. The experimental results on KDD-99 dataset show that decision tree provides better results than other available classifiers. The proposed system obtains the best results of 99.78% accuracy, 99.27% detection rate and false alarm rate of 0.2%, which are better than all the previous results for KDD dataset. We achieved an accuracy of 99.83% for 20% testing data of NSL-KDD dataset and 99.65% accuracy for 10-fold cross-validation on Kyoto dataset. The most attractive characteristic of the proposed scheme is that during the selection of appropriate feature subset, no labeled information is utilized and different feature quality measures are optimized simultaneously using the multi-objective optimization framework.

연구 동기 및 목표

  • 특성 선택 과정에서 레이블 데이터에 의존하지 않는 비지도 특성 선택 방법을 개발하는 것.
  • 다중 특성 품질 측정 기준—상호정보량, 표준편차, 정보량 증가량—을 동시에 최적화하여 관련성 향상과 중복 감소를 도모하는 것.
  • 최소한이지만 매우 정보적인 특성 조합을 선택하여 계산 복잡도를 감소시키고 분류 정확도를 향상시키는 것.
  • 표준 IDS 벤치마크인 KDD-99, NSL-KDD, Kyoto 2006+ 데이터셋에서 프레임워크의 성능을 평가하는 것.
  • 기존의 지도 학습 및 단일목표 특성 선택 방법과 비교하여 뛰어난 성능을 입증하는 것.

제안 방법

  • 다중목표 최적화를 위해 비지미적 분류 유전 알고리즘 II(Non-dominated Sorting Genetic Algorithm II, NSGA-II)를 사용하여 상호정보량, 표준편차, 정보량 증가량의 세 가지 특성 품질 측정 기준을 동시에 최적화한다.
  • 정보 이론 기반 측정 기준을 활용하여 관련성이 높고 중복도가 낮은 특성을 식별하며, 동시에 샘플 간 변동성이 큰 특성에 우선순위를 둔다.
  • 진화적 탐색을 통해 다수의 목표 간 균형을 이룬 파레토 최적 해(front)를 생성함으로써, 다양한 목표 간 상호 보완적 트레이드오프를 보장한다.
  • 선택된 특성 조합을 여러 기계 학습 분류기—결정 트리, 서포트 벡터 머신(SVM), k-최근접 이웃(k-NN, k=5)에 적용하여 최종 분류를 수행한다.
  • KDD-99, NSL-KDD, Kyoto 2006+ 데이터셋에서 10겹 교차검증 및 표준 테스트 분할을 사용하여 평가를 수행한다.
  • 프레임워크는 완전히 비지도—특성 선택 과정에서는 클래스 레이블을 사용하지 않으며, 성능 평가 시에만 사용된다.

실험 결과

연구 질문

  • RQ1레이블 데이터를 사용하지 않고도 다중목표 최적화 프레임워크가 IDS의 특성 조합 선택을 향상시킬 수 있는가?
  • RQ2관련성, 변동성, 중복도의 병합 측정 기준이 IDS 분류 정확도에 어떤 영향을 미치는가?
  • RQ3제안된 비지도 특성 선택 방법이 표준 IDS 벤치마크에서 기존의 지도 학습 및 단일목표 접근 방법보다 뛰어난 성능을 보일 수 있는가?
  • RQ4침입 탐지에서 특성 조합의 크기와 분류 성능 사이의 최적 균형은 무엇인가?
  • RQ5다양한 분류기 간에 파레토 최적 해의 특성 조합을 효과적으로 활용하여 높은 탐지 정확도를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 KDD-99 데이터셋에서 99.78%의 정확도, 99.27%의 탐지율, 오직 0.2%의 위양성 경고율을 기록하며, 이는 이 데이터셋에 대해 이전에 보고된 모든 결과를 초월한다.
  • NSL-KDD 데이터셋에서는 20% 테스트 분할에서 99.83%의 정확도를 달성했으며, 정상, DoS, Probe, U2R, R2L 클래스별로 각각 99.57%에서 99.92%의 정확도를 기록했다.
  • Kyoto 2006+ 데이터셋에서는 10겹 교차검증을 사용하여 99.65%의 정확도를 달성했으며, 이는 다양한 데이터셋 간 강력한 일반화 능력을 보여준다.
  • 최적의 특성 조합은 11~23개의 특성 범위를 가지며 평균 20개의 특성으로, KDD-99 원본의 41개 특성 대비 차원의 압축을 크게 달성했다.
  • 결정 트리 분류기가 KDD-99 데이터셋에서 SVM, k-NN 등 다른 모든 모델 대비 가장 뛰어난 성능을 보였으며, 가장 높은 정확도와 탐지율을 기록했다.
  • 이러한 방법은 레이블 데이터 또는 전체 특성 집합을 사용하는 LSTM 기반 모델 및 개미 군집 최적화 방법과 비교해도 뛰어난 성능을 보였으며, 이는 제안된 방법의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.