[논문 리뷰] Intrusion Alert Prediction Using a Hidden Markov Model
이 논문은 경고 속성들을 클러스터로 묶기 위해 백오프워즈(BoW) 모델과 k-means 클러스터링을 사용하여 향후 침입 경고를 예측하는 히든 마르코프 모델(HMM) 기반 프레임워크를 제안한다. 단일 스텝 및 다섯 스텝 예측에서 각각 81%와 77%의 정확도를 기록하며, 경고 카테고리 예측에서는 95%와 92%의 정확도를 달성한다. 이는 이전의 가변 길이 마르코프 체인 방법보다 카테고리 예측에서 5% 향상되었으며, 대응 조치를 위한 더 풍부한 맥락 정보를 제공한다.
Intrusion detection is only a starting step in securing IT infrastructure. Prediction of intrusions is the next step to provide an active defense against incoming attacks. Current intrusion prediction methods focus mainly on prediction of either intrusion type or intrusion category and do not use or provide contextual information such as source and target IP address. In addition most of them are dependant on domain knowledge and specific scenario knowledge. The proposed algorithm employs a bag-of-words model together with a hidden Markov model which not depend on specific domain knowledge. Since this algorithm depends on a training process it is adaptable to different conditions. A key advantage of the proposed algorithm is the inclusion of contextual data such as source IP address, destination IP range, alert type and alert category in its prediction, which is crucial for an eventual response. Experiments conducted using a public data set generated over 2500 alert predictions and achieved accuracy of 81% and 77% for single step and five step predictions respectively for prediction of the next alert cluster. It also achieved an accuracy of prediction of 95% and 92% for single step and five step predictions respectively for prediction of the next alert category. The proposed methods achieved a prediction accuracy improvement of 5% for alert category over existing variable length Markov chain intrusion prediction methods, while providing more information for a possible defense.
연구 동기 및 목표
- 특정 공격 지식이나 사전 정의된 시나리오에 의존하지 않는 도메인에 관계없이 적용 가능한 침입 경고 예측 시스템을 개발하는 것.
- 경고 유형이나 카테고리뿐 아니라 소스 IP, 대상 IP, 경고 유형까지 예측하여 대응 가능한 방어 조치를 향상시키는 것.
- 여러 경고 속성을 통합하여 통합된 경고 클러스터 표현을 만들어 정확도와 맥락의 풍부함을 향상시키는 것.
- 변경되는 네트워크 조건와 공격 패tern에 맞춰 진화할 수 있는 학습 가능하고 적응 가능한 모델을 만드는 것.
- 기존 방법이 경고 카테고리나 유형에만 집중하며 공격자-피해자 맥락을 고려하지 않는 한계를 보완하는 것.
제안 방법
- 경고 유형, 카테고리, 소스 IP, 대상 IP 범위와 같은 경고 속성을 특징 벡터로 인코딩하기 위해 백오프워즈(BoW) 모델을 사용한다.
- 유사한 경고를 클러스터로 묶기 위해 k-means 클러스터링을 적용하여 차원을 축소하고 시퀀스 모델링을 가능하게 한다.
- 시계열적 의존성을 모델링하고 다음 클러스터를 예측하기 위해 경고 클러스터의 시퀀스에 대해 히든 마르코프 모델(HMM)을 훈련시킨다.
- 기존 경고 시퀀스에서 전이 확률과 방출 확률을 추정하기 위해 하우머-웰치( Baum-Welch ) 알고리즘을 사용하여 HMM을 훈련시킨다.
- 가장 가능성 높은 은닉 상태 시퀀스와 해당 경고 클러스터를 찾기 위해 비터비(Viterbi) 알고리즘을 사용하여 예측을 수행한다.
- 이 프레임워크는 단일 스텝 및 다중 스텝 예측을 모두 지원하며, 평가 기준은 다음 경고 클러스터 또는 카테고리를 정확히 예측하는 정밀도이다.
실험 결과
연구 질문
- RQ1경고 속성들만을 사용하고 도메인 특화 지식 없이도 순차 기반 HMM 모델이 미래 침입 경고를 효과적으로 예측할 수 있는가?
- RQ2경고 클러스터에 소스 IP, 대상 IP, 경고 유형을 포함시키면 카테고리 전용 모델 대비 정확도와 대응 가능성에서 얼마나 향상되는가?
- RQ3침입 경고 예측 정확도를 극대화하기 위해 최적의 경고 클러스터 수와 은닉 상태 수는 얼마인가?
- RQ4제안된 HMM 기반 경고 클러스터 예측 방법은 기존의 가변 길이 마르코프 체인 방법에 비해 경고 카테고리 예측 성능에서 어떻게 비교되는가?
- RQ5학습 데이터에 포함되지 않은 새로운 침입 유형에 대해 모델이 얼마나 잘 일반화되는가?
주요 결과
- 제안된 HMM 기반 경고 클러스터 예측은 DARPA 데이터셋에서 단일 스텝 예측 시 81%의 정확도, 다섯 스텝 예측 시 77%의 정확도를 달성했다.
- 경고 카테고리 예측은 단일 스텝 시 95%, 다섯 스텝 시 92%의 정확도를 기록했으며, 이는 이전의 가변 길이 마르코프 체인 방법보다 5% 향상된 성능이다.
- 클러스터 수가 적을수록 정확도가 높았는데, 예를 들어 5개의 클러스터는 레벨 3 예측에서 88%의 정확도를 기록했다. 그러나 너무 적은 클러스터 수는 서로 다른 경고 유형을 합치는 위험을 수반했다.
- 은닉 상태 수가 많을수록 예측 정확도가 크게 향상되었으며, 5~8개의 은닉 상태는 2~4개의 상태보다 정확도가 24% 높게 나타났다 (레벨 1 예측 기준).
- 이 프레임워크는 소스 및 대상 IP를 포함한 전체 경고 클러스터를 성공적으로 예측하여 표적화되고 맥락 인식 가능한 침입 대응을 가능하게 했다.
- 학습 데이터에 포함되지 않은 침입 유형을 예측하는 데에는 한계가 있으며, 탐지 시스템을 오도시키기 위해 고안된 악성 위조 경고에 여전히 취약하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.