Skip to main content
QUICK REVIEW

[논문 리뷰] Host-based anomaly detection using Eigentraces feature extraction and one-class classification on system call trace data

Ehsan Aghaei, Gürsel Serpen|arXiv (Cornell University)|2019. 11. 25.
Network Security and Intrusion Detection인용 수 9
한 줄 요약

이 논문은 시스템 호출 트레이스에서 주성분 분석(PCA) 기반 특징 추출을 위한 Eigentraces와 이상 탐지에 사용되는 일종의 분류 기반 이상 탐지 시스템을 제안한다. ADFA-LD 데이터셋에서 평가한 결과, 높은 탐지 정확도와 낮은 위양성 경고 비율을 기록하여, RBF 네트워크와 랜덤 포레스트를 활용한 확률 모델링을 통해 정상 행동과 공격 행동을 효과적으로 구분하는 데 강력한 성능을 보였다.

ABSTRACT

This paper proposes a methodology for host-based anomaly detection using a semi-supervised algorithm namely one-class classifier combined with a PCA-based feature extraction technique called Eigentraces on system call trace data. The one-class classification is based on generating a set of artificial data using a reference distribution and combining the target class probability function with artificial class density function to estimate the target class density function through the Bayes formulation. The benchmark dataset, ADFA-LD, is employed for the simulation study. ADFA-LD dataset contains thousands of system call traces collected during various normal and attack processes for the Linux operating system environment. In order to pre-process and to extract features, windowing on the system call trace data followed by the principal component analysis which is named as Eigentraces is implemented. The target class probability function is modeled separately by Radial Basis Function neural network and Random Forest machine learners for performance comparison purposes. The simulation study showed that the proposed intrusion detection system offers high performance for detecting anomalies and normal activities with respect to a set of well-accepted metrics including detection rate, accuracy, and missed and false alarm rates.

연구 동기 및 목표

  • 시스템 호출 트레이스를 활용한 호스트 기반 침입 탐지용 준감독 이상 탐지 프레임워크를 개발하는 것.
  • 주성분 분석(PCA) 기반 차원 축소 기법인 Eigentraces를 통해 시스템 호출 시퀀스의 특징 표현을 향상시키는 것.
  • 정상 행동를 모델링하고 변칙을 탐지하기 위해 베이지안 밀도 추정을 활용한 일종의 분류 기반 이상 탐지 방법을 적용하는 것.
  • 검출률, 정확도, 위양성 경고 비율, 누락 경고 비율 등의 표준 지표를 사용하여 성능을 평가하는 것.
  • 제안된 프레임워크 내에서 RBF 네트워크와 랜덤 포레스트 등의 다양한 확률 추정기의 효과성을 비교하는 것.

제안 방법

  • Eigentraces는 먼저 시스템 호출 트레이스 데이터를 고정 크기의 윈도우로 분할한 후, 각 윈도우에 대해 주성분 분석(PCA)을 수행하여 주요 특징을 추출함으로써 적용된다.
  • 결과적으로 도출된 주성분들은 시스템 호출 행동의 압축된, 저차원 표현을 형성하여 노이즈와 중복을 감소시킨다.
  • 일종의 분류 기반 이상 탐지는 기준 분포와 인위적 데이터를 조합하여 목표 클래스의 밀도 함수를 추정하는 베이지안 공식을 활용하여 구현된다.
  • 목표 클래스의 확률 함수는 두 가지 기계 학습 모델인 라디얼 기저 함수(RBF) 신경망과 랜덤 포레스트를 사용하여 모델링된다.
  • 레이블이 부여된 이상 데이터가 없을 경우 정상 클래스의 밀도 추정을 향상시키기 위해 기준 분포를 바탕으로 인위적 데이터를 생성한다.
  • 최종 이상 탐지 결정은 새로운 시스템 호출 트레이스의 추정 밀도를 사전에 학습된 정상 밀도 임계값과 비교함으로써 내림받는다.

실험 결과

연구 질문

  • RQ1Eigentraces는 이상 탐지에 효과적으로 유의미한 특징을 시스템 호출 트레이스에서 추출할 수 있는가?
  • RQ2정상 학습 데이터만 제공될 경우, 베이지안 밀도 추정을 활용한 일종의 분류 기반 이상 탐지는 이상을 얼마나 잘 탐지하는가?
  • RQ3정상 행동 밀도 함수를 모델링할 때 RBF 네트워크와 랜덤 포레스트의 상대적 성능은 어떠한가?
  • RQ4실제 시스템 호출 트레이스 데이터에서 제안된 방법이 위양성 및 누락 탐지 비율을 얼마나 줄이는가?
  • RQ5PCA 기반 특징 추출과 일종의 분류 기반 이상 탐지를 통합하면 준감독 환경에서 높은 탐지 정확도를 달성할 수 있는가?

주요 결과

  • 제안된 시스템은 ADFA-LD 벤치마크 데이터셋에서 높은 검출률을 기록하였으며, 성능 지표는 강력한 이상 탐지 능력을 시사한다.
  • Eigentraces의 사용은 PCA를 통해 시스템 호출 시퀀스의 주요 패턴을 효과적으로 포착함으로써 특징 표현을 크게 향상시켰다.
  • 베이지안 밀도 추정을 활용한 일종의 분류 기반 이상 탐지는 정상 행동를 효과적으로 모델링하여 변칙의 탐지를 신뢰성 있게 가능하게 하였다.
  • 보고된 시뮬레이션 연구에서 RBF 신경망은 랜덤 포레스트보다 검출률과 위양성 경고 비율 측면에서 뛰어난 성능을 보였다.
  • 시스템은 낮은 위양성 및 누락 탐지 비율을 기록하여 정상 행동와 이상 행동를 신뢰성 있게 구분하는 데 있어 강건성과 신뢰성을 입증하였다.
  • Eigentraces와 일종의 분류 기반 이상 탐지의 통합은 실시간 호스트 기반 침입 탐지에 적합한 압축되고 효율적인 모델을 도출하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.