Skip to main content
QUICK REVIEW

[논문 리뷰] Data Mining with Big Data in Intrusion Detection Systems: A Systematic Literature Review

Fadi Salo, MohammadNoor Injadat|arXiv (Cornell University)|2020. 05. 23.
Network Security and Intrusion Detection참고 문헌 43인용 수 6
한 줄 요약

이 체계적 문헌 고찰은 2013–2018년 동안 빅데이터 기반 침입 탐지 시스템(IPS)에서 사용된 데이터 마이닝 기법(DMT)에 대해 32篇의 연구를 분석한다. 의사결정 트리, 베이지안 네트워크, k-means, 서포트 벡터 머신(SVM), 인공신경망(ANN)이 가장 흔한 DMT로 나타났다. 연구 결과, 실시간 성능에서 스파크(Spark)가 하둡(Hadoop)을 능가하는 것으로 나타났으며, 66%의 실험에서 오래된 데이터셋인 DARPA를 사용하여 탐지 정확도와 실시간 공격 분류 능력이 제한되었다.

ABSTRACT

Cloud computing has become a powerful and indispensable technology for complex, high performance and scalable computation. The exponential expansion in the deployment of cloud technology has produced a massive amount of data from a variety of applications, resources and platforms. In turn, the rapid rate and volume of data creation has begun to pose significant challenges for data management and security. The design and deployment of intrusion detection systems (IDS) in the big data setting has, therefore, become a topic of importance. In this paper, we conduct a systematic literature review (SLR) of data mining techniques (DMT) used in IDS-based solutions through the period 2013-2018. We employed criterion-based, purposive sampling identifying 32 articles, which constitute the primary source of the present survey. After a careful investigation of these articles, we identified 17 separate DMTs deployed in an IDS context. This paper also presents the merits and disadvantages of the various works of current research that implemented DMTs and distributed streaming frameworks (DSF) to detect and/or prevent malicious attacks in a big data environment.

연구 동기 및 목표

  • 2013년부터 2018년까지 빅데이터 환경에서 침입 탐지 시스템(IPS)에 사용된 데이터 마이닝 기법(DMT)을 식별하고 분석하기 위해.
  • 기존 IPS 솔루션에서 사용된 DMT 및 분산 스트리밍 프레임워크(DSF)의 강점과 약점을 평가하기 위해.
  • IDS에서 DMT 성능을 검증하기 위해 사용된 평가 지표를 검토하고 벤치마킹의 일관성 부족을 평가하기 위해.
  • 검토된 IDS가 대상으로 삼은 사이버 공격 유형과 실험에 사용된 데이터셋의 특성을 조사하기 위해.
  • 향후 연구를 위한 권고사항을 제시하기 위해. 특히 실시간 탐지, 최신 데이터셋, 스파크와 같은 고성능 빅데이터 도구의 도입을 강조한다.

제안 방법

  • 킨처셈과 찰츠의 프레임워크를 따르는 체계적 문헌 고찰(SLR)을 실시하여 계획, 실행, 보고 단계를 포함한다.
  • 6개의 디지털 라이브러리(IEEE Xplore, ACM, Web of Science, 엘스비어, 스프링거, 와일리)를 검색하여 최초 545篇의 논문을 확보하였다.
  • 포괄/배제 기준과 품질 평가 기준을 적용하여 관련 연구를 걸러내어 분석 대상으로 32篇의 주요 논문을 확정하였다.
  • 의사결정 트리, 베이지안 네트워크, k-means, SVM, 인공신경망(ANN) 등을 포함한 IDS에서 사용된 DMT를 분류하고, 주성분 분석(PCA)과 카이제곱 검정 등 특징 선택(FS) 기법을 평가하였다.
  • 하둡, 스파크, 스톰과 같은 분산 스트리밍 프레임워크(DSF)를 분석하여 실시간 침입 탐지에서의 성능을 비교하였다.
  • 다양한 연구 간 평가 지표(예: TPR, 정확도, FPR, TST, TRT)와 공격 분류 능력을 매핑하여 일관성 부족과 격차를 파악하였다.

실험 결과

연구 질문

  • RQ1빅데이터 환경에서 IDS에 사용된 데이터 마이닝 기법은 무엇인가?
  • RQ2문헌에서 사용된 DMT 및 DSF의 강점과 약점은 무엇인가?
  • RQ3IDS에서 DMT 성능을 검증하기 위해 사용된 평가 지표는 무엇인가?
  • RQ4문헌의 IDS가 대상으로 삼는 공격 유형은 무엇이며, 실험에 사용된 데이터셋의 특성은 무엇인가?

주요 결과

  • 빅데이터 기반 IDS에서 가장 흔히 사용된 데이터 마이닝 기법은 의사결정 트리, 베이지안 네트워크, k-means 군집화, 인공신경망(ANN), 지원 벡터 머신(SVM)이다.
  • 주성분 분석(PCA)이 가장 흔히 사용된 특징 선택(FS) 기법이지만, 66%의 연구에서 FS를 적용하지 않아 시스템 효율성이 저하될 수 있다.
  • 하둡이 가장 널리 사용된 분산 스트리밍 프레임워크(DSF)였지만, 스파크는 실시간 처리 및 확장성에서 뛰어난 성능을 보였다.
  • 가장 자주 보고된 평가 지표는 효율성에 대한 진짜 양성률(TPR), 정확도(Acc), 위양성률(FPR)이며, 성능에 대한 총 처리 시간(TST), 통신 비용(CC), 총 응답 시간(TRT)이 주로 사용되었다.
  • 66%의 실험에서 오래된 DARPA 데이터셋을 사용하여 제안된 IDS 솔루션의 일반화 가능성과 실제 적용 효과성이 떨어질 수 있다.
  • 대부분의 연구에서 공격을 정상 또는 악성으로만 분류하였으며, 실시간으로 특정 공격 유형을 분류할 수 있는 능력이 제한되어 있어 세밀한 공격 탐지에 있어 심각한 격차가 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.