Skip to main content
QUICK REVIEW

[논문 리뷰] Towards resilient machine learning for ransomware detection

Li Chen, Chih-Yuan Yang|arXiv (Cornell University)|2018. 12. 21.
Advanced Malware Detection Techniques참고 문헌 50인용 수 21
한 줄 요약

이 논문은 기계학습 기반 랜섬웨어 탐지기구를 회피하기 위해 악성 행동을 모방하면서도 정상적으로 보이게 하는 적대적 동적 특징을 생성하기 위해 GAN 기반 프레임워크를 제안한다. 실제 탐지에서 높은 정확도를 보였음에도 불구하고 테스트된 분류기 7개 중 6개가 GAN에 의해 생성된 샘플을 탐지하지 못해 기계학습 기반 랜섬웨어 방어의 핵심적인 취약성이 드러났다.

ABSTRACT

There has been a surge of interest in using machine learning (ML) to automatically detect malware through their dynamic behaviors. These approaches have achieved significant improvement in detection rates and lower false positive rates at large scale compared with traditional malware analysis methods. ML in threat detection has demonstrated to be a good cop to guard platform security. However it is imperative to evaluate - is ML-powered security resilient enough? In this paper, we juxtapose the resiliency and trustworthiness of ML algorithms for security, via a case study of evaluating the resiliency of ransomware detection via the generative adversarial network (GAN). In this case study, we propose to use GAN to automatically produce dynamic features that exhibit generalized malicious behaviors that can reduce the efficacy of black-box ransomware classifiers. We examine the quality of the GAN-generated samples by comparing the statistical similarity of these samples to real ransomware and benign software. Further we investigate the latent subspace where the GAN-generated samples lie and explore reasons why such samples cause a certain class of ransomware classifiers to degrade in performance. Our focus is to emphasize necessary defense improvement in ML-based approaches for ransomware detection before deployment in the wild. Our results and discoveries should pose relevant questions for defenders such as how ML models can be made more resilient for robust enforcement of security objectives.

연구 동기 및 목표

  • 기계학습 기반 랜섬웨어 탐지 시스템의 적대적 공격에 대한 내성 강도를 평가하기 위해.
  • 실제 랜섬웨어 행동을 모방하는 동적 특징을 자동으로 생성할 수 있는 GAN 기반 프레임워크를 개발하기 위해.
  • 생성된 샘플의 악성 정도와 실제 랜섬웨어 및 정상 소프트웨어와의 통계적 유사도를 정량화하기 위해.
  • 적대적 샘플이 위치한 잠재 특징 공간을 분석하여 기존 분류기의 맹점(블라인드 스팟)을 특정하기 위해.
  • 생산 환경에 배포하기 전에 모델의 강성 향상을 위해 적대적 훈련 및 품질 측정 지표를 제안하기 위해.

제안 방법

  • 실제 랜섬웨어 및 정상 응용 프로그램의 동적 시스템 로그를 기반으로 생성적 적대적 네트워크(GAN)를 훈련하여 적대적 특징 시퀀스를 생성하기 위해.
  • 통계적 유사도 측정 지표(예: K-S 검정, 워샤프스키 거리)를 사용하여 GAN에 의해 생성된 로그와 실제 정상 및 악성 로그를 비교하기 위해.
  • 생성된 샘플을 잠재 특징 공간(예: Text-CNN 임베딩)으로 매핑하여 분류기의 취약성을 분석하기 위해.
  • GAN에 의해 생성된 특징 시퀀스를 실제 I/O 작업(예: 파일 이름 변경, 고엔트로피 쓰기)으로 매핑하는 랜섬웨어 시뮬레이션 프로그램을 개발하여 실제 악성 행동을 생성하기 위해.
  • 생성된 샘플이 악성 의도를 유지하면서도 탐지 회피를 가능하게 하기 위해 적대적 품질 측정 지표를 적용하기 위해.
  • 기존 랜섬웨어 분류기의 강성 향상을 위해 GAN에 의해 생성된 샘플을 사용하여 적대적 훈련을 수행하기 위해.

실험 결과

연구 질문

  • RQ1GAN에 의해 생성된 동적 특징은 최신 기계학습 기반 랜섬웨어 탐지기구를 성공적으로 회피할 수 있는가?
  • RQ2통계적 분포 측면에서 GAN에 의해 생성된 샘플은 실제 랜섬웨어와 정상 소프트웨어와 얼마나 유사한가?
  • RQ3적대적 샘플은 어떤 잠재 특징 하위공간에 위치해 있으며, 왜 이로 인해 분류기 성능 저하가 발생하는가?
  • RQ4생성된 샘플의 악성 정도와 탐지 회피 능력을 신뢰성 있게 평가할 수 있는 적대적 품질 측정 지표는 무엇인가?
  • RQ5GAN에 의해 생성된 샘플을 사용한 적대적 훈련은 실제 운영 환경에서 랜섬웨어 분류기의 내성 강도 향상에 기여하는가?

주요 결과

  • 실제 데이터에서 높은 정확도를 보였음에도 불구하고, 테스트된 7개의 랜섬웨어 분류기 중 6개가 GAN에 의해 생성된 적대적 샘플의 대부분을 탐지하지 못했다.
  • GAN에 의해 생성된 샘플은 원래 특징 공간에서는 실제 랜섬웨어와 높은 통계적 유사도를 보였지만, Text-CNN 잠재 공간에서는 정상 로그에 더 가까웠으며, 이는 분류기의 블라인드 스팟에 위치해 있음을 시사한다.
  • Text-CNN 분류기는 특히 적대적 샘플이 자신의 잠재 공간에서 정상 로그에 더 가까웠기 때문에 특히 취약했으며, 이는 그들이 이를 탐지하지 못한 이유를 설명한다.
  • SVM-radial 및 XGB-Text-CNN 앙상블 분류기는 더 높은 강성 향상을 보였으며, 이는 다중 분류기 앙상블이 적대적 탐색에 대비한 방어의 깊이를 높일 수 있음을 시사한다.
  • 제안된 적대적 품질 측정 지표는 악성 정도와 유사도를 효과적으로 정량화하여 생성된 샘플의 신뢰성 있는 평가를 가능하게 하였다.
  • 이 프레임워크는 기계학습 탐지 기능을 회피하면서도 완전한 랜섬웨어 기능을 유지하는 실제 I/O 시퀀스를 성공적으로 생성하여 실질적인 회피 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.