Skip to main content
QUICK REVIEW

[논문 리뷰] An Interpretable Federated Learning-based Network Intrusion Detection Framework

Tian Dong, Song Li|arXiv (Cornell University)|2022. 01. 10.
Network Security and Intrusion Detection인용 수 7
한 줄 요약

이 논문은 개인 정보 보호, 해석 가능성, 확장성을 고려한 새로운 피어드 학습 기반 네트워크 침입 탐지 프레임워크인 FedForest를 제안한다. 기울기 부스팅 결합 트리(GBDT)와 피어드 학습을 결합하여, 원천 네트워크 데이터를 클라이언트 측에 국한시키면서도 고정밀도의 침입 탐지를 가능하게 한다. 클라이언트 데이터에서 로컬 GBDT 모델을 학습하고 서버에서 이를 집계함으로써 FedForest는 다양한 사이버 공격 작업에서 높은 정확도를 달성하면서도, 미리 알 수 없는 공격의 실시간 탐지와 차등적 개인정보 보호 및 머신 언러닝을 통한 개인정보 보호 기법을 통해 강화된 기밀성 보장을 실현한다.

ABSTRACT

Learning-based Network Intrusion Detection Systems (NIDSs) are widely deployed for defending various cyberattacks. Existing learning-based NIDS mainly uses Neural Network (NN) as a classifier that relies on the quality and quantity of cyberattack data. Such NN-based approaches are also hard to interpret for improving efficiency and scalability. In this paper, we design a new local-global computation paradigm, FEDFOREST, a novel learning-based NIDS by combining the interpretable Gradient Boosting Decision Tree (GBDT) and Federated Learning (FL) framework. Specifically, FEDFOREST is composed of multiple clients that extract local cyberattack data features for the server to train models and detect intrusions. A privacy-enhanced technology is also proposed in FEDFOREST to further defeat the privacy of the FL systems. Extensive experiments on 4 cyberattack datasets of different tasks demonstrate that FEDFOREST is effective, efficient, interpretable, and extendable. FEDFOREST ranks first in the collaborative learning and cybersecurity competition 2021 for Chinese college students.

연구 동기 및 목표

  • 기존의 학습 기반 NIDS의 한계, 특히 낮은 해석 가능성, 개인정보 보호의 부재, 그리고 알려지지 않은 공격에 대한 대처 어려움을 해결한다.
  • 피어드 학습을 활용해 원천 네트워크 데이터를 클라이언트 측에 유지함으로써 공동 침입 탐지에서 발생하는 데이터 개인정보 유출 문제를 해결한다.
  • 블랙박스 신경망 대신 기울기 부스팅 결합 트리(GBDT)를 도입함으로써 모델의 해석 가능성과 확장성을 향상시킨다.
  • 초기 재학습 없이도 증분 학습을 통해 알려지지 않은 공격을 탐지할 수 있도록 한다.
  • 차등적 개인정보 보호 및 머신 언러닝과 같은 고도의 개인정보 보호 기법을 통합하여 클라이언트 데이터의 복원 공격으로부터 보호한다.

제안 방법

  • 각 클라이언트가 자체적인 개인 네트워크 트래픽 데이터에서 로컬 GBDT 모델을 학습하는 클라이언트-서버 아키텍처를 설계한다.
  • 서버에서 FedAvg 유사 집계를 사용하여 클라이언트의 모델 업데이트를 집계함으로써 침입 탐지용 글로벌 GBDT 분류기 학습을 수행한다.
  • 기울기의 보정된 노이즈를 추가하여 모델 업데이트에 차등적 개인정보 보호를 적용함으로써 $͔$-차등적 개인정보 보호를 확보하며, $͔ \in \{5, 10, 20, 50\}$를 적용한다.
  • SISA를 영감으로 삼은 머신 언러닝 메커니즘을 구현하여, 영향을 받는 서버 분류기만 재학습함으로써 클라이언트를 모델에서 제거할 수 있도록 한다.
  • 전송 전에 클라이언트 특징을 익명화하기 위한 데이터 인코딩 기법을 적용하여, DLG와 같은 데이터 泄露 공격에 대한 저항력을 강화한다.
  • 다양한 데이터셋에서 성능을 최적화하기 위해 LightGBM 및 XGBoost 설정에 대한 그리드 서치를 통한 초모수 튜닝을 수행한다.

실험 결과

연구 질문

  • RQ1GBDT 기반 피어드 학습 아키텍처가 다중 작업 네트워크 침입 탐지에서 높은 정확도를 달성하면서도 데이터 기밀성을 유지할 수 있는가?
  • RQ2차등적 개인정보 보호의 통합이 다양한 사이버 공격 탐지 작업에서 FedForest 모델의 정확도와 유용성에 어떤 영향을 미치는가?
  • RQ3증분 학습을 통해 FedForest는 알려지지 않은 또는 제로데이 공격을 얼마나 잘 탐지하고 적응할 수 있는가?
  • RQ4제안된 머신 언러닝 메커니즘은 최소한의 재학습 비용으로 특정 클라이언트의 영향을 글로벌 모델에서 효과적으로 제거할 수 있는가?
  • RQ5아키텍처나 모델 구조의 변경 없이도 FedForest는 다양한 침입 탐지 작업에서 해석 가능성과 확장성을 유지할 수 있는가?

주요 결과

  • FedForest는 2021년 중국 대학생 공동 학습 및 사이버보안 경연 대회에서 최고 성능을 기록하여 1위를 차지했다.
  • DDoS2019, DoHBrw2020, Darknet2020, MalDroid2020의 네 가지 다양한 데이터셋에서 FedForest는 모든 작업에서 높은 정확도를 달성하여 강력한 일반화 능력과 확장성을 입증했다.
  • 값이 $͔ = 5$일 때, 더 강력한 개인정보 보호를 유지하면서도 높은 정확도 스코어를 유지했으며, 비개인정보 보호 기반의 DNN 기반 NIDS보다 유용성-기밀성 트레이드오프에서 뛰어난 성능을 보였다.
  • 값이 낮아질수록(개인정보 보호가 강화될수록) 정확도는 감소했지만, 차등적 개인정보 보호를 적용하지 않은 기준 DNN보다 여전히 유의미하게 높은 성능를 유지했다.
  • 머신 언러닝은 효율적으로 지원되었으며, 클라이언트를 제거하기 위해 나머지 클라이언트만으로 서버 분류기를 재학습하는 것으로 충분했으며, 계산 오버헤드가 최소한이었다.
  • FedForest는 기존의 공격 유형을 성공적으로 분류했고, 이상치 점수를 통한 탐지로 알려지지 않은 공격을 탐지하여 인간 전문가의 추가 분석을 위한 개입을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.