[논문 리뷰] A Novel Deep Learning based Model to Defend Network Intrusion Detection System against Adversarial Attacks
이 논문은 네 가지 강력한 회피 공격—FGSM, JSMA, PGD, C&W—에 대비해 네트워크 침입 탐지 시스템(NIDS)의 강건성을 향상시키기 위해 적대적 훈련을 활용하는 딥러닝 기반 방어 메커니즘을 제안한다. 적대적 훈련을 거친 후, 대부분의 방법에서 공격 하에서의 모델 정확도가 62% 이하에서 98% 이상으로 향상되었으며, C&W 공격는 여전히 가장 도전적인 것으로 나타나 71.56%의 정밀도를 기록하였다.
Network Intrusion Detection System (NIDS) is an essential tool in securing cyberspace from a variety of security risks and unknown cyberattacks. A number of solutions have been implemented for Machine Learning (ML), and Deep Learning (DL) based NIDS. However, all these solutions are vulnerable to adversarial attacks, in which the malicious actor tries to evade or fool the model by injecting adversarial perturbed examples into the system. The main aim of this research work is to study powerful adversarial attack algorithms and their defence method on DL-based NIDS. Fast Gradient Sign Method (FGSM), Jacobian Saliency Map Attack (JSMA), Projected Gradient Descent (PGD) and Carlini & Wagner (C&W) are four powerful adversarial attack methods implemented against the NIDS. As a defence method, Adversarial Training is used to increase the robustness of the NIDS model. The results are summarized in three phases, i.e., 1) before the adversarial attack, 2) after the adversarial attack, and 3) after the adversarial defence. The Canadian Institute for Cybersecurity Intrusion Detection System 2017 (CICIDS-2017) dataset is used for evaluation purposes with various performance measurements like f1-score, accuracy etc.
연구 동기 및 목표
- 딥러닝 기반 NIDS가 네 가지 주요 적대적 공격 방법—FGSM, JSMA, PGD, C&W—에 얼마나 취약한지 조사하기.
- 정확도, 정밀도, 재현율, F1 점수와 같은 표준 지표를 사용해 이러한 적대적 공격 하에서 딥러닝 기반 NIDS의 성능 저하를 평가하기.
- 적대적 훈련을 방어 수단으로 구현하고 검증하여 회피 공격에 대한 모델의 강건성을 향상시키기.
- 제한된 도메인인 네트워크 침입 탐지가 이미지 분류와 같은 제한되지 않은 도메인만큼 적대적 예외에 취약한지 분석하기.
- 적대적 훈련이 강력한 적대적 공격에 노출된 후 모델 성능을 근사 기준 수준으로 복원할 수 있는지 실증적 증거 제공하기.
제안 방법
- 정상 조건 하에서 기준 성능를 확보하기 위해 CICIDS-2017 데이터셋을 기반으로 딥 네트워크(DNN) 모델을 훈련한다.
- FGSM, JSMA, PGD, C&W의 네 가지 적대적 공격 방법을 적용하여 탐지 회피를 위한 변형된 입력을 생성한다.
- 모든 네 가지 공격 방법에서 얻은 정상 샘플과 적대적 변형 샘플을 모두 사용해 모델을 재훈련함으로써 적대적 훈련을 구현한다.
- 적대적 훈련 이후 모델을 재평가하여 동일한 공격 조건 하에서 정확도, 정밀도, 재현율, F1 점수, AUC의 향상을 측정한다.
- F1 점수, AUC, 혼동 행렬을 포함한 지표들을 사용해 세 단계—공격 이전, 공격 이후, 방어 이후—간 성능을 정량적으로 비교한다.
- 특히 C&W 공격와 같은 최신 기술을 적용했을 때도 높은 성능를 유지할 수 있는지 모델의 능력을 측정함으로써 방어의 강건성 평가한다.
실험 결과
연구 질문
- RQ1FGSM, JSMA, PGD, C&W 공격는 CICIDS-2017 데이터셋에서 딥러닝 기반 NIDS의 성능을 어떻게 악화시키는가?
- RQ2적대적 훈련은 이러한 공격의 영향을 NIDS의 강건성에 얼마나 줄일 수 있는가?
- RQ3왜 C&W 공격는 방어 조치 이후에도 여전히 모델 성능 악화에 가장 효과적인가?
- RQ4제한된 도메인인 네트워크 침입 탐지 분야도 이미지 인식과 같은 제한되지 않은 도메인만큼 적대적 예외에 취약한가?
- RQ5강력한 적대적 공격에 노출된 후 적대적 훈련이 모델 성능을 근사 기준 수준으로 복원할 수 있는가?
주요 결과
- 기본 NIDS 모델은 적대적 공격 없이도 98.54%의 정확도와 98.54%의 F1 점수를 기록하였다.
- FGSM, JSMA, PGD, C&W 공격 적용 후 정확도는 각각 57.95%, 66.58%, 56.81%, 61.74%로 하락하여 심각한 성능 저하가 발생하였다.
- AUC 점수는 98.551에서 FGSM 기준 59.232, JSMA 기준 68.037, PGD 기준 58.485, C&W 기준 63.41로 감소하여 탐지 능력 저하가 확인되었다.
- 적대적 훈련 이후 정확도는 FGSM 기준 98.7%, JSMA 기준 98.47%, PGD 기준 98.68%, C&W 기준 71.56%로 향상되어 강력한 방어 효과가 입증되었다.
- C&W 공격 이후 정밀도는 80.35%로 가장 낮아, C&W 공격는 여전히 방어하기 가장 어려운 공격로 남아 있음을 시사한다.
- 결과적으로, 제한된 도메인인 NIDS에서도 적대적 훈련과 같은 적절한 방어 수단이 없이 딥러닝 모델은 여전히 적대적 공격에 매우 취약함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.