Skip to main content
QUICK REVIEW

[논문 리뷰] An AI-based, Multi-stage detection system of banking botnets

Ling Li, Zhiqiang Gao|arXiv (Cornell University)|2019. 07. 18.
Spam and Phishing Detection참고 문헌 6인용 수 4
한 줄 요약

이 논문은 은행 봇넷을 조기에 경고하고 DGA 탐지, 피싱 URL 식별, DNS 터널링을 위한 AI 기반의 다단계 탐지 시스템을 제안한다. 이 시스템은 사이버 데이터 레이크와 딥러닝 모델—특히 LSTM 네트워크—를 활용하여 기존 기준 모델 대비 10배 이상의 가짜 양성률 감소를 달성했으며, DGA에 대한 AUC는 0.9965, 피싱 URL 분류에 대한 AUC는 0.9956을 기록했다.

ABSTRACT

Banking Trojans, botnets are primary drivers of financially-motivated cybercrime. In this paper, we first analyzed how an APT-based banking botnet works step by step through the whole lifecycle. Specifically, we present a multi-stage system that detects malicious banking botnet activities which potentially target the organizations. The system leverages Cyber Data Lake as well as multiple artificial intelligence techniques at different stages. The evaluation results using public datasets showed that Deep Learning based detections were highly successful compared with baseline models.

연구 동기 및 목표

  • 기존 탐지 방식으로는 회피되는 APT 기반 은행 봇넷의 증가하는 위협에 대응하고, 악성 활동 지속 기간을 최대 498일까지 연장하는 것을 방지한다.
  • 고속 네트워크 환경에서 매우 중요한 가짜 양성률 감소를 달성한다.
  • 완전한 시스템 침입 이전에 스피어 피싱 캠페인과 악성 인프라를 조기에 탐지할 수 있도록 한다.
  • 중앙집중식 사이버 데이터 레이크를 활용해 LSTM, 그래프 분석 등의 다수의 AI 기법을 통합한 단일 탐지 프레임워크를 구현한다.
  • 공개 및 내부 위협 데이터를 기반으로 한 딥러닝을 통해 사이버 침입 체인의 여러 단계에서 탐지 정확도를 향상시킨다.

제안 방법

  • 내부 및 외부 소스로부터 유형이 다른 보안 데이터셋을 수신, 정규화 및 저장하기 위해 중앙집중식 플랫폼으로서 사이버 데이터 레이크를 활용한다.
  • 사이버 침입 체인(CKC) 모델에 부합하는 다단계 탐지 파이프라인을 구현하며, 탐지 범위는 조사, 배포, 침투, C2, 목표 달성 단계를 포함한다.
  • 도메인 이름의 문자 수준 시퀀스를 활용해 악성(DGA 생성) 또는 양성으로 분류하기 위해 장기적 단기 기억(LSTM) 네트워크를 적용한다.
  • 입력 시퀀스 길이가 최대 128자인 LSTM 기반 모델을 사용해 피싱 URL 탐지에 활용하며, 문자 임bedding과 드롭아웃(0.5)을 활용해 정규화를 수행한다.
  • 과적합을 방지하기 위해 학습 중 조기 정지 및 하이퍼파라미터 튜닝을 적용하고, ROC 곡선과 AUC를 사용해 모델 평가를 수행한다.
  • 운영 단계에서 화이트리스트 및_BLK리스트를 적용해 노이즈를 줄이고 탐지 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1LSTM과 같은 딥러닝 모델이 기존의 n-gram 및 bag-of-words 기반 기준 모델 대비 DGA 및 피싱 URL 탐지에서 가짜 양성률을 크게 감소시킬 수 있는가?
  • RQ2사이버 데이터 레이크 기반의 다단계 탐지 시스템이 공격 전 과정, 특히 초기 단계의 조사 단계까지도 봇넷 활동을 전체 공격 라이프사이클에 걸쳐 탐지할 수 있는가?
  • RQ3공개 데이터셋으로 훈련된 LSTM 기반 모델이 AUC 및 FPR 지표를 사용해 악성 도메인과 URL을 탐지하는 데 얼마나 효과적인가?
  • RQ4LSTM 및 그래프 분석과 같은 AI 기법의 통합이 은행 봇넷 캠페인의 탐지 정확도 향상과 지속 기간 단축에 기여할 수 있는가?
  • RQ5고급 딥러닝 모델과 전통적인 머신러닝 모델을 비교했을 때 탐지율과 가짜 양성률 간의 성능 트레이드오프는 어떠한가?

주요 결과

  • LSTM 모델은 DGA 분류에서 AUC 0.9965를 기록했으며, 기준 n-gram 모델(AUC 0.9610)보다 뚜렷이 뛰어난 성능을 보였다.
  • 피싱 URL 탐지에서 LSTM 모델은 AUC 0.9956을 달성했으며, 기준 bag-of-words 모델(AUC 0.9687)보다 높은 성능을 보였다.
  • 진짜 양성률 91%에서 LSTM 모델은 가짜 양성률 0.7%를 기록했고, 동일한 탐지 임계값에서 기준 모델은 가짜 양성률 8%를 기록했다.
  • 유사한 탐지율에서 LSTM 모델은 기준 모델 대비 가짜 양성률을 10배 이상 감소시켜 고속 네트워크 환경에서 매우 실용적인 가치를 입증했다.
  • 학습 역사 분석 결과, 에포크 수에 관계없이 안정적이고 일관된 검증 성능을 보여, LSTM 모델이 과적합되지 않았음을 확인했다.
  • GPU 클러스터에서 하드웨어 최적화된 LSTM 추론을 통해 6배의 속도 향상을 달성했으며, 이는 생산 환경에서의 확장 가능한 구현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.