[논문 리뷰] Expansion of Cyber Attack Data From Unbalanced Datasets Using Generative Techniques
이 논문은 생성적 적대적 네트워크(GANs)를 사용하여 불균형한 사이버공격 데이터셋, 특히 UGR’16 데이터셋을 보강함으로써 분류기 성능을 향상시키는 것을 제안한다. GAN 기반의 데이터 확장은 소수의 공격 클래스를 균형 잡도록 하여 모델 정확도, AUC-ROC, 정밀도-재현율 지표를 크게 향상시킨다.
Machine learning techniques help to understand patterns of a dataset to create a defense mechanism against cyber attacks. However, it is difficult to construct a theoretical model due to the imbalances in the dataset for discriminating attacks from the overall dataset. Multilayer Perceptron (MLP) technique will provide improvement in accuracy and increase the performance of detecting the attack and benign data from a balanced dataset. We have worked on the UGR'16 dataset publicly available for this work. Data wrangling has been done due to prepare test set from in the original set. We fed the neural network classifier larger input to the neural network in an increasing manner (i.e. 10000, 50000, 1 million) to see the distribution of features over the accuracy. We have implemented a GAN model that can produce samples of different attack labels (e.g. blacklist, anomaly spam, ssh scan). We have been able to generate as many samples as necessary based on the data sample we have taken from the UGR'16. We have tested the accuracy of our model with the imbalance dataset initially and then with the increasing the attack samples and found improvement of classification performance for the latter.
연구 동기 및 목표
- 공격 샘플이 정상 트래픽에 비해 훨씬 적은 불균형한 데이터셋에서의 침입 탐지 시스템(IDS) 도전 과제를 해결한다.
- 생성 기법을 사용하여 소수의 공격 클래스를 균형 잡음으로써 기계학습 분류기의 일반화 능력과 탐지 정확도를 향상시킨다.
- UGR’16 데이터셋에서 실제 데이터 분포를 기반으로 실재감 있는 사이버공격 샘플을 합성하는 GAN 기반 프레임워크를 개발한다.
- 표준 지표인 AUC-ROC 및 정밀도-재현율 곡선을 사용하여 데이터 증강의 모델 성능에 미치는 영향을 평가한다.
제안 방법
- 학습 및 테스트의 주요 자료로 UGR’16 데이터셋을 사용하였으며, 균형 잡힌 테스트 세트를 준비하기 위해 데이터 워글링을 적용하였다.
- 실제 공격 샘플과 생성된 공격 샘플을 구분하기 위해 GAN 아키텍처에서 심층 신경망(MLP)을 디스criminator로 구현하였다.
- 실제 데이터 분포를 기반으로 여러 공격 유형(예: 블랙리스트, SSH 스캔, 이상 스팸 등)의 합성 공격 샘플을 생성하기 위한 생성자 네트워크를 훈련시켰다.
- 훈련 입력 크기를 점진적으로 증가시켜(10k, 50k, 1M개 샘플) 특성 분포와 모델 확장성 평가를 수행하였다.
- 혼합된 데이터 유형(예: IP 주소 등)을 신경망 입력에 적합한 수치적 표현으로 변환하기 위해 특성 공학을 적용하였다.
- 불균형 및 GAN 기반 보정된 균형 잡힌 데이터셋에서 AUC-ROC 및 정밀도-재현율 곡선을 사용하여 모델 성능을 평가하였다.
실험 결과
연구 질문
- RQ1GAN 기반의 데이터 생성은 UGR’16과 같은 불균형한 사이버공격 데이터셋을 효과적으로 균형 잡아 분류기 성능을 향상시킬 수 있는가?
- RQ2합성 공격 샘플의 포함 여부가 신경망 기반 IDS의 AUC-ROC 및 정밀도-재현율 지표에 어떤 영향을 미치는가?
- RQ3GAN을 통한 데이터 증강은 불균형 데이터셋에서 정상 트래픽에 대한 과적합을 어느 정도 감소시키는가?
- RQ4다양한 입력 크기(10k에서 1M개 샘플)가 합성 데이터 존재 하에서 특성 분포와 모델 정확도에 어떤 영향을 미치는가?
주요 결과
- GAN 기반 보정된 균형 잡힌 데이터셋은 AUC-ROC 값이 거의 1.0에 도달하여 거의 완벽한 모델 성능를 나타내었고, 불균형 케이스에서는 0.80이었다.
- 정밀도-재현율 AUC는 불균형 데이터셋의 약 0.2에서 GAN 보정된 균형 잡힌 데이터셋에서는 거의 1.0으로 크게 향상되었다.
- 증강된 데이터셋으로 훈련된 모델은 공격 샘플이 충분히 확보되어 정상 트래픽에 대한 과적합을 피할 수 있어 정확도가 크게 향상되었다.
- GAN을 통한 합성 데이터 사용은 다수 클래스에 대한 편향을 효과적으로 완화시켜 소수 공격 유형의 탐지 능력을 향상시켰다.
- 확장된 데이터셋으로 훈련된 모델은 다양한 공격 유형에서 강건성과 개선된 일반화 능력을 보였다.
- 하드웨어 제약으로 인한 계산 자원 제약에도 불구하고, GAN 기반 접근법은 UGR’16 데이터셋의 일부에 대해 실현 가능하고 확장 가능한 것으로 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.