[논문 리뷰] Anomaly Sequences Detection from Logs Based on Compression
이 논문은 통계적 가정이나 마르코프 가정에 의존하지 않고 이상 현상의 정도를 측정하기 위해 문법 기반 압축을 사용하는 로그 시퀀스를 위한 새로운 이상 탐지 방법을 제안한다. 정상적인 시퀀스로 훈련을 수행하고 이상 시퀀스를 추가했을 때 압축 크기의 증가를 측정함으로써 고수준 이상 및 저수준 이상을 효과적으로 식별하며, 실제 시스템 호출 트레이스에서 버그 탐지 및 침입 탐지에서 뛰어난 성능을 보였다.
Mining information from logs is an old and still active research topic. In recent years, with the rapid emerging of cloud computing, log mining becomes increasingly important to industry. This paper focus on one major mission of log mining: anomaly detection, and proposes a novel method for mining abnormal sequences from large logs. Different from previous anomaly detection systems which based on statistics, probabilities and Markov assumption, our approach measures the strangeness of a sequence using compression. It first trains a grammar about normal behaviors using grammar-based compression, then measures the information quantities and densities of questionable sequences according to incrementation of grammar length. We have applied our approach on mining some real bugs from fine grained execution logs. We have also tested its ability on intrusion detection using some publicity available system call traces. The experiments show that our method successfully selects the strange sequences which related to bugs or attacking.
연구 동기 및 목표
- 대규모 로그에서 비결정적 시스템 장애를 탐지하는 과제를 해결하기 위해, 특히 클라우드 컴퓨팅 환경에서의 적용을 목표로 한다.
- 기존의 마르코프 가정이나 확률 모델에 의존하는 이상 탐지 방법의 한계를 극복하여 고수준의 비정상 행동을 놓치지 않도록 한다.
- 정보 내용에 기반하여 압축을 활용해 경량이고 구조 인식 능력을 갖춘 이상 탐지 방법을 개발한다.
- 실제 로그를 대상으로 버그 탐지 및 침입 탐지에 대해 평가하여 다양한 시스템 행동에서의 효과성을 입증한다.
제안 방법
- 훈련 로그 시퀀스에서 정상 행동 패턴을 학습하기 위해 문법 기반 압축(특히 SEQUITUR 알고리즘)을 사용한다.
- 후보 시퀀스의 이상 정도를, 훈련 세트에 시퀀스를 추가했을 때 압축 크기의 증가량($I_n = Q_n - Q_0$)을 계산하여 측정한다.
- 핵심 아이디어는 이상 시퀀스가 정상 패턴과의 구조적 이탈과 낮은 압축 가능성으로 인해 압축 크기의 증가가 더 크다는 데 있다.
- 통계 모델링을 피하기 위해 정보 이론 원리에 기반하여 압축 가능성은 구조적 규칙성과 예측 가능성과 관련이 있음을 활용한다.
- 효율성을 위해 후보 시퀀스를 기존 문법 규칙과 일치시키기 위해 접두사 트리 데이터 구조를 사용한다.
- 이상치를 순위 매기기 위해 압축 크기의 절대 증가량($I_n$)과 정보 밀도($D_n = I_n / \text{sequence length}$)를 모두 기반으로 시퀀스를 평가한다.
실험 결과
연구 질문
- RQ1압축 기반 이상 탐지 방법은 통계 모델에 의존하지 않고 미세한 실행 로그에서 고수준 비정상 행동을 효과적으로 식별할 수 있는가?
- RQ2기존의 마르코프 기반 접근 방식과 비교해 볼 때, 이 방법은 시스템 호출 트레이스에서 알려진 침입을 얼마나 잘 탐지하는가?
- RQ3실제 시스템 호출 트레이스에서 구조적 특성과 압축 가능성 특성만을 사용해 양호한 행동과 악성 행동을 구분할 수 있는가?
- RQ4생산 환경의 대규모 로그 데이터에 적용했을 때 이 방법의 성능 오버헤드는 얼마나 되는가?
주요 결과
- xlock 데이터셋에서 알려진 2개의 공격을 당한 프로세스를 모두 탐지했으며, 정보 밀도($D$) 값이 상위 정상 시퀀스보다 2배 이상 높았다.
- named 데이터셋에서는 5개의 가장 이상적인 시퀀스 중 3개를 식별했으며, 정보 밀도 값이 정상 시퀀스보다 뚜렷이 높았다.
- xlock 데이터셋의 경우 상위 5개의 정상 시퀀스는 $I_n$ 값이 46에서 776 사이였고, 두 개의 공격을 받은 시퀀스는 각각 $I_n = 183$과 $176$이었으며, 강력한 이상 신호를 나타냈다.
- 이 방법은 높은 처리량을 보였다: memcached 로그에서는 초당 85,409.5개의 항목, large named 데이터셋에서는 초당 585.4개의 항목을 처리했다.
- 알고리즘은 $I_n = 1$인 시퀀스가 훈련 시퀀스의 복제일 가능성이 높다는 것을 정확히 식별하여 반복 패턴 처리에 대한 강건성을 보였다.
- 이 방법은 국소 상태 전이를 넘어서 구조적 패턴을 포착하므로, 전통적인 마르코프 기반 모델보다 고수준 이상 탐지에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.