[논문 리뷰] DeepHTTP: Semantics-Structure Model with Attention for Anomalous HTTP Traffic Detection and Pattern Mining
DeepHTTP는 양방향 LSTM와 주의 메커니즘을 사용하여 의미-구조 통합 딥러닝 모델을 제안하여 비정상적인 HTTP 트래픽을 탐지하고 악성 패턴을 탐지한다. HTTP 요청을 자연어 시퀀스로 간주하고 내용의 의미적 특성과 구조적 특성을 결합함으로써 높은 탐지 정확도와 효과적인 패턴 발견을 달성하며, 주의 메커니즘이 'wscript'와 'shell'과 같은 핵심 공격 지표를 강조한다.
In the Internet age, cyber-attacks occur frequently with complex types. Traffic generated by access activities can record website status and user request information, which brings a great opportunity for network attack detection. Among diverse network protocols, Hypertext Transfer Protocol (HTTP) is widely used in government, organizations and enterprises. In this work, we propose DeepHTTP, a semantics structure integration model utilizing Bidirectional Long Short-Term Memory (Bi-LSTM) with attention mechanism to model HTTP traffic as a natural language sequence. In addition to extracting traffic content information, we integrate structural information to enhance the generalization capabilities of the model. Moreover, the application of attention mechanism can assist in discovering critical parts of anomalous traffic and further mining attack patterns. Additionally, we demonstrate how to incrementally update the data set and retrain model so that it can be adapted to new anomalous traffic. Extensive experimental evaluations over large traffic data have illustrated that DeepHTTP has outstanding performance in traffic detection and pattern discovery.
연구 동기 및 목표
- HTTP 트래픽에 대한 복잡하고 진화하는 사이버 공격을 다루는 데 있어 전통적 이상 탐지 방법의 한계를 해결하기 위해.
- HTTP 요청의 의미적 특성과 구조적 특성을 통합하여 모델의 일반화 능력과 강건성을 향상시키기 위해.
- 사전 지식 없이 악성 트래픽의 자동 탐지 및 공격 패턴의 탐지 가능성을 높이기 위해.
- 시간이 지남에 따라 새로운 공격 변종에 적응하기 위해 점진적 학습을 지원하기 위해.
- 주의 메커니즘을 통해 악성 트래픽의 핵심 키워드를 강조함으로써 결과의 해석 가능성을 제공하기 위해.
제안 방법
- HTTP 요청 내용을 자연어 시퀀스로 간주하고, 토큰을 임베딩으로 매핑하여 의미 모델링을 수행한다.
- HTTP 항목을 분할하여 구조적 특징을 추출하고, 콘텐츠 클립을 구조적 표현으로 변환한다.
- 의미적 특성과 구조적 특성을 별도로 학습하기 위해 두 개의 별도된 Bi-LSTM 네트워크를 사용한 후, 출력 결과를 연결한다.
- 입력 시퀀스의 핵심 단어에 집중하기 위해 주의 메커니즘을 적용하고, 설명 가능성을 위한 주의 가중치를 생성한다.
- 완전 연결 층을 사용하여 의미적 특성과 구조적 특성 벡터를 결합하여 최종 분류를 수행한다.
- 탐지된 악성 트래픽에 대해 클러스터링을 수행하고, 주의 가중치가 부여된 키워드를 사용하여 패턴 마이닝을 적용하여 반복적인 공격 서명을 식별한다.
실험 결과
연구 질문
- RQ1HTTP 트래픽의 의미적 특성과 구조적 특성을 통합한 딥러닝 모델이 이상 탐지 성능을 향상시킬 수 있는가?
- RQ2주의 메커니즘이 악성 HTTP 트래픽의 핵심 지표를 얼마나 효과적으로 강조할 수 있는가?
- RQ3SQL 인젝션, XSS, 웹쉘과 같은 알려진 공격 패밀리에서 모델이 탐지 및 패턴 탐지 기능을 수행할 수 있는가?
- RQ4점진적 학습과 데이터셋 업데이트를 통해 모델이 새로운 악성 트래픽에 얼마나 잘 적응할 수 있는가?
- RQ5주의 메커니즘이 악성 트래픽의 특성에 대해 설명 가능한 통찰을 제공할 수 있는가?
주요 결과
- Structs2 취약성에 대해, 상위 5개 주의 가중치를 가진 단어에서 재현율이 0.822로 나타났고, 상위 20개 단어에서는 0.964로 상승했다.
- SQL 인젝션 패턴 탐지에서 높은 성능을 보였으며, 상위 20개 주의 단어에서 'select'의 재현율이 0.871, 'limit'는 0.799였다.
- XSS 공격에 대해 모델은 'script'와 'iframe'을 고의미도 키워드로 정확히 식별했으며, 상위 10개 주의 단어에서 각각 재현율이 0.820과 0.721이었다.
- 주의 메커니즘이 'wscript', 'execute', 'action'과 같은 핵심 공격 용어를 성공적으로 강조하여 실제 지표와 밀접하게 일치시켰다.
- 패턴 마이닝 시각화 결과, {'¡', '/', 'textarea', 'script', '¿', 'alert'}와 같은 공존 클러스터가 확인되어 스크립트 기반 공격 탐지를 확인할 수 있었다.
- 모델는 'etc'와 'passwd'에 대해 상위 20개 단어에서 각각 0.948 이상의 재현율을 기록하여 다양한 공격 유형, 특히 파일 포함 및 웹쉘 패턴에 대해 높은 성능 유지를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.