[논문 리뷰] Identifying Relevant Features of CSE-CIC-IDS2018 Dataset for the Development of an Intrusion Detection System
이 논문은 침입 탐지 시스템(IDS) 성능을 최적화하기 위해 CSE-CIC-IDS2018 데이터셋을 대상으로 체계적인 특성 선택 파이프라인을 제안한다. 여섯 가지 특성 선택 방법을 적용하고 그 점수를 평균화함으로써 다섯 가지 공격 유형에 대해 최소화된 고영향도 특성 집합을 규명하였다. 랜덤 포레스트 및 트리 기반 분류기로 최소 7개의 특성만으로도 정확도가 거의 완벽한 수준(최대 1.00000)에 도달하였다.
Intrusion detection systems (IDSs) are essential elements of IT systems. Their key component is a classification module that continuously evaluates some features of the network traffic and identifies possible threats. Its efficiency is greatly affected by the right selection of the features to be monitored. Therefore, the identification of a minimal set of features that are necessary to safely distinguish malicious traffic from benign traffic is indispensable in the course of the development of an IDS. This paper presents the preprocessing and feature selection workflow as well as its results in the case of the CSE-CIC-IDS2018 on AWS dataset, focusing on five attack types. To identify the relevant features, six feature selection methods were applied, and the final ranking of the features was elaborated based on their average score. Next, several subsets of the features were formed based on different ranking threshold values, and each subset was tried with five classification algorithms to determine the optimal feature set for each attack type. During the evaluation, four widely used metrics were taken into consideration.
연구 동기 및 목표
- CSE-CIC-IDS2018 데이터셋에서 침입 탐지 성능을 높이기 위해 최소화되고 관련성이 높은 특성 집합을 식별한다.
- 다양한 특성 선택 방법과 순위 기준 임계값이 분류 성능에 미치는 영향을 평가한다.
- 다섯 가지 공격 유형(FTP, SSH, WEB, XSS, SQL 인젝션)에 대해 최적의 특성 집합과 분류기 조합을 결정한다.
- 완전한 차원 수 입력 대비 감소된 특성 집합이 탐지 정확도를 유지하거나 향상시키는지 평가한다.
- 이상 기반 IDS 개발을 위한 재사용 가능하고 데이터 기반의 워크플로우를 제공한다.
제안 방법
- 사전 처리된 CSE-CIC-IDS2018 데이터에 대해 정보 이득, 카이제곱, 상관관계, ReliefF, 순차적 특성 제거, ANOVA F-검정의 여섯 가지 특성 선택 방법을 적용하였다.
- 각 방법에서 도출된 개별 특성 점수를 정규화하고, 모든 기법을 종합해 평균 점수를 계산하여 특성 순위를 매겼다.
- 다섯 가지 공격 유형에 대해 1~44개의 특성으로 구성된 다양한 특성 집합을 생성하기 위해 여섯 개의 순위 기준 임계값을 정의하였다.
- Orange 소프트웨어를 사용하여 각 특성 집합에 대해 로지스틱 회귀, 랜덤 포레스트, 결정 트리, 서포트 벡터 머신, 나이브 베이즈의 다섯 가지 분류기를 훈련시켰다.
- 훈련 및 테스트 데이터셋에서 정확도, 정밀도, 재현율, F1-스코어의 네 가지 지표를 사용해 모델 성능을 평가하였다.
- 각 공격 유형에 대해 가장 높은 F1-스코어와 전체 성능 안정성을 기준으로 최고 성능을 보인 모델과 특성 집합을 선정하였다.

실험 결과
연구 질문
- RQ1CSE-CIC-IDS2018 데이터셋에서 특정 공격 유형(FTP, SSH, WEB, XSS, SQL 인젝션)을 탐지하는 데 가장 관련성이 높은 특성들은 무엇인가?
주요 결과
- FTP 공격의 경우, 순위 기준 임계값 0.35에서 선택된 8개 특성으로 랜덤 포레스트를 사용해 정확도, 정밀도, 재현율, F1-스코어 모두 100%를 달성하였다.
- SSH 공격의 경우, 임계값 0.35에서 7개 특성으로 랜덤 포레스트를 사용해 정확도 99.999%를 기록하여 거의 완벽한 탐지 성능을 보였다.
- WEB 공격의 경우, 임계값 0.35에서 44개 특성이 필요로 하여 99.994%의 정확도를 달성하였고, 트리 기반 분류기가 가장 우수한 성능을 보였다.
- XSS 공격의 경우, 임계값 0.45에서 10개 특성으로 랜덤 포레스트를 사용해 99.999%의 정확도를 기록하였으며, 다른 모델들보다 뛰어난 성능을 보였다.
- SQL 인젝션 탐지의 경우, 임계값 0.40에서 26개 특성으로 트리 기반 분류기를 사용해 정확도 99.999%를 달성하였고, F1-스코어는 0.97647이었다.
- 트리 기반 및 랜덤 포레스트 분류기는 모든 공격 유형에서 다른 분류기들보다 뛰어난 성능을 보였으며, 특히 특성 수가 감소한 경우에 뚜렷한 우위를 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.