Skip to main content
QUICK REVIEW

[논문 리뷰] Machine learning-assisted virtual patching of web applications

Gustavo Betarte, Eduardo Giménez|arXiv (Cornell University)|2018. 03. 14.
Network Security and Intrusion Detection참고 문헌 7인용 수 9
한 줄 요약

이 논문은 웹 애플리케이션을 위한 기계학습 기반 가상 패치 기법을 제안하며, one-class 분류와 n-gram 분석을 활용해 ModSecurity의 탐지 정확도를 향상시키고 가짜 경고를 줄인다. 이 방법은 정상 트래픽 패턴을 기반으로 이상 탐지 기반으로 작동하여, 라벨이 부여된 공격 데이터가 없는 환경에서 조차도 기본 OWASP Core Rule Set보다 우수한 성능을 보이며, 저자료 또는 고자료 환경 모두에서 구현이 가능하다.

ABSTRACT

Web applications are permanently being exposed to attacks that exploit their vulnerabilities. In this work we investigate the application of machine learning techniques to leverage Web Application Firewall (WAF), a technology that is used to detect and prevent attacks. We propose a combined approach of machine learning models, based on one-class classification and n-gram analysis, to enhance the detection and accuracy capabilities of MODSECURITY, an open source and widely used WAF. The results are promising and outperform MODSECURITY when configured with the OWASP Core Rule Set, the baseline configuration setting of a widely deployed, rule-based WAF technology. The proposed solution, combining both approaches, allow us to deploy a WAF when no training data for the application is available (using one-class classification), and an improved one using n-grams when training data is available.

연구 동기 및 목표

  • ModSecurity와 같은 규칙 기반 웹 애플리케이션 방화벽(WAF)의 높은 가짜 경고 비율과 유연성 부족 문제를 해결한다.
  • 기계학습을 활용해 정상 애플리케이션 동작을 학습함으로써 WAF의 탐지 능력을 향상시키며, 특히 라벨이 부여된 공격 데이터가 없는 환경에서 유의미한 성능 향상을 이룬다.
  • zero-day 공격에 대비하기 위해 one-class 분류를 활용하고, 훈련 데이터가 가용할 경우 고정밀도 탐지를 위한 n-gram 분석을 조합하는 보완적 접근 방식을 개발한다.
  • 소스 코드가 제공되지 않거나 패치 적용이 불가능한 실세계 환경에서 지능형 WAF의 실용적 구현을 가능하게 한다.
  • ModSecurity와 같은 기존 WAF에 기계학습을 통합할 수 있는 프레임워크를 제공하여 수동 설정 최소화와 보안 수준 향상을 도모한다.

제안 방법

  • 기존 공격 패턴에서 유도된 특징을 기반으로 정상 웹 요청 행동을 모델링하기 위해 one-class 분류를 사용하며, 라벨이 부여된 공격 데이터가 없더라도 이상 탐지를 가능하게 한다.
  • 웹 파라미터의 입력 시퀀스 통계 분포를 모델링하기 위해 n-gram 분석을 적용하며, 구성 가능한 n까지의 가변 길이 n-gram을 사용해 구조적 패턴을 포착한다.
  • 예를 들어 이메일과 같은 희소한 필드의 경우 짧은 n을 설정하여 민감도를 최적화하고 희소성 문제를 줄인다.
  • 합법적인 트래픽을 기반으로 n-gram 모델을 훈련하여 기대되는 입력 분포를 학습하고, 이로부터의 이탈을 악성 공격로 간주한다.
  • 두 모델의 출력을 레이블 융합(normal/attack) 방식으로 조합하여 탐지의 강건성과 적응성을 향상시킨다.
  • ModSecurity의 로깅 및 점검 파이프라인을 활용해 실시간 트래픽 분석이 가능한 플러그인 레이어로 기계학습 모델을 통합한다.

실험 결과

연구 질문

  • RQ1응용 프로그램 전용 훈련 데이터가 전혀 없을 경우, one-class 분류가 WAF 탐지 성능을 향상시킬 수 있는가?
  • RQ2정상 트래픽에서 훈련된 n-gram 기반 이상 탐지 기법이 악성 페이로드를 얼마나 효과적으로 식별할 수 있는가?
  • RQ3one-class 분류와 n-gram 분석의 조합이 탐지율과 가짜 경고 비율 측면에서 기본 OWASP Core Rule Set을 초월할 수 있는가?
  • RQ4모델 파라미터(예: n-gram 길이, 특징 선택)가 다양한 웹 애플리케이션 유형에서 성능에 미치는 영향은 어떠한가?
  • RQ5기계학습 기반 가상 패치가 실생산 환경에서 수동 규칙 설정의 필요성을 얼마나 줄일 수 있는가?

주요 결과

  • 응용 프로그램 전용 훈련 데이터가 없는 상황에서 one-class 분류 모델은 ModSecurity의 OWASP Core Rule Set보다 더 우수한 탐지율과 가짜 경고 비율을 달성했다.
  • n-gram 기반 이상 탐지 모델은 테스트 데이터셋 중 3개 중 2개에서 ModSecurity의 기본 설정보다 뚜렷이 뛰어난 정확도를 보이며 악성 입력을 효과적으로 식별했다.
  • 두 모델의 조합은 자료 부족 환경(One-class)과 자료 풍부 환경(n-gram) 모두에 적용 가능한 강력한 솔루션을 제공했다.
  • 제안된 방법은 ModSecurity 로그에서 가짜 경고를 식별함으로써 수동 규칙 설정 최소화에 기여했다.
  • n-gram 모델은 기존에 알려지지 않은 공격 패턴에 대해 기대되는 입력 패턴의 이탈을 탐지함으로써 zero-day 공격에 강력한 저항성을 보였다.
  • ModSecurity와 같은 기존 WAF에 통합 가능한 실용성 있는 프레임워크를 입증하였으며, 내장 모듈 개발을 위한 명확한 길을 제시했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.