[논문 리뷰] A Deep Belief Network Based Machine Learning System for Risky Host Detection
이 논문은 SIEM 경고, 보안 로그 및 분석가 조사 결과를 활용하여 기업 환경에서 위험한 호스트를 탐지하기 위해 딥 빌리프 네트워크(DBN) 기반의 머신러닝 시스템을 제안한다. 텍스트 마이닝과 그래프 기반 특징 공학을 통해 시스템은 가짜 경고를 감소시키고 실제 엔터프라이즈 데이터에서 기존 룰 기반 시스템 대비 6배 더 뛰어난 성능을 달성한다.
To assure cyber security of an enterprise, typically SIEM (Security Information and Event Management) system is in place to normalize security event from different preventive technologies and flag alerts. Analysts in the security operation center (SOC) investigate the alerts to decide if it is truly malicious or not. However, generally the number of alerts is overwhelming with majority of them being false positive and exceeding the SOC's capacity to handle all alerts. There is a great need to reduce the false positive rate as much as possible. While most previous research focused on network intrusion detection, we focus on risk detection and propose an intelligent Deep Belief Network machine learning system. The system leverages alert information, various security logs and analysts' investigation results in a real enterprise environment to flag hosts that have high likelihood of being compromised. Text mining and graph based method are used to generate targets and create features for machine learning. In the experiment, Deep Belief Network is compared with other machine learning algorithms, including multi-layer neural network, random forest, support vector machine and logistic regression. Results on real enterprise data indicate that the deep belief network machine learning system performs better than other algorithms for our problem and is six times more effective than current rule-based system. We also implement the whole system from data collection, label creation, feature engineering to host score generation in a real enterprise production environment.
연구 동기 및 목표
- 보안 운영 센터(SOC)에서 분석가들을 압도하는 높은 수준의 가짜 경고 경고를 줄이기 위해.
- 실제 엔터프라이즈 보안 데이터를 기반으로 머신러닝을 활용해 손상된 호스트의 탐지 능력을 향상시키기 위해.
- 데이터 수집부터 호스트 스코어링까지의 전 과정을 아우르는 확장성 있는 종단 간 시스템을 개발하기 위해.
- 기존 머신러닝 모델과 룰 기반 시스템을 능가하여 높은 손상 가능성의 호스트를 식별하는 데 목적이 있다.
제안 방법
- 보안 로그 및 경고 설명에 대한 텍스트 마이닝을 통해 의미적 특징을 추출한다.
- 호스트, 이벤트 및 경고 간의 관계를 모델링하기 위해 그래프 기반 방법을 사용하여 구조적 특징을 생성한다.
- 텍스트 및 그래프 분석에서 유도된 특징을 딥 빌리프 네트워크(DBN)에 입력하여 계층적 표현 학습을 수행한다.
- 그리디 레이어와의 사전 훈련 방법을 사용한 후 피니팅을 수행하여 DBN을 훈련시킨다.
- 분석가의 조사 결과로부터 레이블을 생성하여 알려진 위험한 호스트를 기반으로 모델을 훈련시킨다.
- DBN의 출력을 바탕으로 최종 호스트 위험 스코어를 생성하여 높은 위험도의 시스템을 우선순위로 지정할 수 있도록 한다.
실험 결과
연구 질문
- RQ1딥 빌리프 네트워크는 보안 로그 및 경고의 복잡한 패턴을 효과적으로 학습하여 위험한 호스트를 탐지하는 데에 적합한가?
- RQ2DBN의 성능은 SVM, 랜덤 포레스트, 로지스틱 회귀와 같은 기존 머신러닝 모델에 비해 위험 탐지에서 어떻게 비교되는가?
- RQ3제안된 시스템은 룰 기반 접근 방식에 비해 가짜 경고를 어느 정도 감소시킬 수 있는가?
- RQ4시스템은 종단 간 데이터 처리 기능을 갖춘 실제 엔터프라이즈 프로덕션 환경에 성공적으로 구현될 수 있는가?
주요 결과
- DBN 기반 시스템은 다층 신경망, 랜덤 포레스트, SVM, 로지스틱 회귀 등 다른 머신러닝 모델보다 위험한 호스트 탐지에서 뛰어난 성능을 보였다.
- 실제 엔터프라이즈 환경에서 기존 룰 기반 탐지 시스템 대비 시스템의 효과성이 6배 향상되었다.
- 텍스트 마이닝과 그래프 기반 특징 공학의 통합은 모델이 복잡한 공격 패턴을 포착하는 데에 상당한 기여를 하였다.
- 시스템은 실제 엔터프라이즈 프로덕션 환경에 성공적으로 구현되어 확장성과 실용성을 입증하였다.
- DBN의 계층적 특징 학습 능력 덕분에 복잡하고 노이즈가 많은 보안 이벤트 데이터에 대해 더 나은 일반화 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.