[논문 리뷰] SCADS: A Scalable Approach Using Spark in Cloud for Host-based Intrusion Detection System with System Calls
이 논문은 Google 클라우드에서 Apache Spark를 활용하여 대규모 Linux 애플리케이션의 시스템 호출 트레이스를 처리하는 확장 가능한 호스트 기반 침입 탐지 시스템인 SCADS를 제안한다. Spark 클러스터를 통해 계산을 분산하고, n-gram 특징 추출 및 TF-IDF 가중치를 적용함으로써 SCADS는 높은 탐지 정확도와 선형 확장성을 달성하여 기존 단일 호스트 기반 접근 방식에 비해 효율성과 대용량 데이터 워크로드에 대한 적응성에서 뛰어나다.
Following the current big data trend, the scale of real-time system call traces generated by Linux applications in a contemporary data center may increase excessively. Due to the deficiency of scalability, it is challenging for traditional host-based intrusion detection systems deployed on every single host to collect, maintain, and manipulate those large-scale accumulated system call traces. It is inflexible to build data mining models on one physical host that has static computing capability and limited storage capacity. To address this issue, we propose SCADS, a corresponding solution using Apache Spark in the Google cloud environment. A set of Spark algorithms are developed to achieve the computational scalability. The experiment results demonstrate that the efficiency of intrusion detection can be enhanced, which indicates that the proposed method can apply to the design of next-generation host-based intrusion detection systems with system calls.
연구 동기 및 목표
- 현대 데이터 센터에서 대규모 시스템 호출 트레이스를 처리하는 데 어려움을 겪는 기존 호스트 기반 침입 탐지 시스템(HIDS)의 확장성 한계를 해결한다.
- 단일 호스트 시스템의 계산 및 스토리지 병목 현상을 해소하기 위해 클라우드 기반 분산 컴퓨팅을 활용한다.
- Apache Spark를 클라우드 인프라와 통합하여 실시간 탐지 효율성을 향상시킬 수 있는 확장 가능한 프레임워크를 설계한다.
- 실제 시스템 호출 트레이스와 표준 머신 러닝 분류기들을 사용하여 제안된 프레임워크의 성능과 확장성을 평가한다.
제안 방법
- 여러 가상 머신에서 생성된 대규모 시스템 호출 트레이스를 처리하기 위해 Google 클라우드에서 Apache Spark를 활용한 분산 컴퓨팅 프레임워크를 구현한다.
- 단일 길이 n-gram 외에도 다양한 길이의 n-gram을 사용하여 시스템 호출 시퀀스를 표현함으로써 짧은 범위와 긴 범위의 행동 패턴을 모두 포착한다.
- Spark의 IDF 모델을 활용해 TF-IDF 벡터화를 수행함으로써 빈번하지만 특징이 뚜렷하지 않은 시스템 호출에 대한 과적합을 줄이고 특징 표현과 탐지 정확도를 향상시킨다.
- Spark 엑스큐터를 통해 병렬 처리가 가능한 분산 머신 러닝 분류기(LR-LBFGS 및 SVM)를 활용하여 처리 효율성을 높인다.
- Dataproc API를 통해 Spark 클러스터를 동적으로 확장하여 다양한 계산 부하 하에서 수평적 확장성과 성능을 평가한다.
- n-gram의 최대 길이를 1, 6, 10로 설정한 다중 길이 n-gram 방법을 사용하여 시퀀스 길이가 탐지 성능에 미치는 영향을 평가한다.
실험 결과
연구 질문
- RQ1클라우드 기반의 Spark 네이티브 프레임워크는 대규모 시스템 호출 트레이스 처리에 대해 효과적으로 확장 가능한가?
- RQ2다양한 길이의 n-gram(단일 길이 대비 다중 길이) 선택이 분산 환경에서 탐지 정확도에 어떤 영향을 미치는가?
- RQ3시스템 호출 기반 HIDS에서 원시 텀 빈도 대비 TF-IDF 특징 가중치 적용이 탐지 성능 향상에 얼마나 기여하는가?
- RQ4Spark 클러스터에 분산된 경우, LR-LBFGS와 SVM 분류기 간의 정확도 및 실행 시간 성능는 어떻게 다른가?
- RQ5Spark 엑스큐터 수가 증가함에 따라 제안된 프레임워크의 확장성은 어느 정도인가?
주요 결과
- LR-LBFGS 분류기에서 다중 길이 n-gram 방법이 단일 길이 n-gram 방법보다 탐지 정확도에서 뛰어나며, 특히 n 값이 1에서 10 사이일 경우 두드러진 성능 향상을 보였다.
- Spark IDF 모델을 통해 조정된 TF-IDF 특징 벡터는 원시 TF 벡터에 비해 탐지 정확도가 유의미하게 향상되었으며, 후자는 성능이 불안정한 경향을 보였다.
- 최대 n-gram 길이가 10으로 설정되었을 때, LR-LBFGS 분류기가 SVM 분류기보다 더 높은 AUC 값을 기록하여 더 나은 일반화 성능을 보였다.
- LR-LBFGS의 경우 최대 n-gram 길이가 5를 초과하면 AUC 값이 정체되었고, SVM의 경우 3를 초과하면 동일한 경향을 보였다. 이는 이들 임계값을 초과하면 수익 감소 효과가 나타남을 시사한다.
- 엑스큐터 수가 1에서 6으로 증가함에 따라 Spark 엑스큐터의 평균 작업 시간이 크게 감소하여 SCADS 프레임워크의 강력한 선형 확장성 특성을 입증했다.
- LR-LBFGS 분류기가 n=10일 때 더 긴 n-gram 시퀀스를 처리하는 데 있어 SVM에 비해 더 효율적인 성능을 보여, 수용 가능한 확장성과 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.