Skip to main content
QUICK REVIEW

[논문 리뷰] RansomAI: AI-powered Ransomware for Stealthy Encryption

Jan von der Assen, Alberto Huertas Celdrán|arXiv (Cornell University)|2023. 06. 27.
Advanced Malware Detection Techniques인용 수 6
한 줄 요약

RansomAI는 강화학습 기반 프레임워크로, AI 기반 이상 탐지 시스템을 회피하기 위해 암호화 행동을 동적으로 적응시킬 수 있도록 해주는 것이다. 라즈베리 파이 4에서 딥 Q러닝과 이소레이션 포레스트를 사용해 평가한 결과, RansomAI는 2분 이내에 90% 이상의 정확도로 탐지 회피에 성공하여 AI 기반 스텔스 기술의 실현 가능성을 입증했다.

ABSTRACT

Cybersecurity solutions have shown promising performance when detecting ransomware samples that use fixed algorithms and encryption rates. However, due to the current explosion of Artificial Intelligence (AI), sooner than later, ransomware (and malware in general) will incorporate AI techniques to intelligently and dynamically adapt its encryption behavior to be undetected. It might result in ineffective and obsolete cybersecurity solutions, but the literature lacks AI-powered ransomware to verify it. Thus, this work proposes RansomAI, a Reinforcement Learning-based framework that can be integrated into existing ransomware samples to adapt their encryption behavior and stay stealthy while encrypting files. RansomAI presents an agent that learns the best encryption algorithm, rate, and duration that minimizes its detection (using a reward mechanism and a fingerprinting intelligent detection system) while maximizing its damage function. The proposed framework was validated in a ransomware, Ransomware-PoC, that infected a Raspberry Pi 4, acting as a crowdsensor. A pool of experiments with Deep Q-Learning and Isolation Forest (deployed on the agent and detection system, respectively) has demonstrated that RansomAI evades the detection of Ransomware-PoC affecting the Raspberry Pi 4 in a few minutes with >90% accuracy.

연구 동기 및 목표

  • 실시간으로 암호화 행동을 적응시켜 기존의 동적 탐지 시스템을 회피할 수 있는 증가하는 AI 기반 랜섬웨어 위협을 해결하기 위해.
  • 강화학습이 랜섬웨어 행동을 최적화하여 최대 피해를 줄이고 탐지 위험을 최소화하는 데 사용될 수 있는지 조사하기 위해.
  • 실제 자원 제약이 있는 환경에서 지문 분석 및 머신러닝 기반 이상 탐지 시스템을 회피하는 RL 기반 에이전트의 효과성을 검증하기 위해.
  • 랜섬웨어가 적응형이고 지능적인 암호화 전략을 사용하도록 진화할 경우 현재의 사이버 보안 방어 조치가 기하학적으로 무용지물이 될 수 있음을 보여주기 위해.

제안 방법

  • 프레임워크는 보상 메커니즘을 통해 최적의 랜섬웨어 설정(암호화 알고리즘, 속도, 지속 시간)을 학습하는 강화학습 에이전트를 활용한다.
  • 보상 함수는 암호화 속도와 은폐성 간의 균형을 맞추며, 은폐성은 이소레이션 포레스트 기반 이상 탐지 시스템의 출력으로 측정된다.
  • 에이전트는 관측된 보상 기반으로 Q값을 업데이트하는 딥 Q러닝(DQN)을 사용해 다양한 설정을 탐색하고 활용한다.
  • 지문 분석 메커니즘이 장치 고유의 행동 패턴을 캡처하여 이상 탐지 시스템을 훈련시키며, 각 랜섬웨어 설정의 은폐성 여부를 평가한다.
  • 실제 PoC 랜섬웨어(Ransomware-PoC)를 라즈베리 파이 4에 통합하여 커뮤니티 센서 환경을 시뮬레이션했다.
  • 활성화 함수, 네트워크 깊이, 가중치 초기화 방법 등을 통해 하이퍼파라미터 튜닝을 수행하여 학습 속도와 정확도를 최적화했다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 실시간으로 랜섬웨어 암호화 행동을 적응시켜 탐지 확률을 최소화하면서도 암호화 속도를 극대화할 수 있는가?
  • RQ2실제 자원 제약이 있는 장치 환경에서 RL 기반 에이전트는 지문 분석 및 머신러닝 기반 이상 탐지 시스템을 얼마나 효과적으로 회피할 수 있는가?
  • RQ3네트워크 깊이, 활성화 함수, 학습률 등의 하이퍼파라미터 설정 중 어떤 조합이 RansomAI 프레임워크에서 가장 빠르고 정확한 탐지 회피 행동을 이끌어내는가?
  • RQ4탐지 모델의 선택(예: 이소레이션 포레스트)이 에이전트가 은폐 가능한 설정을 학습하는 데 미치는 영향은 어느 정도인가?
  • RQ5이 프레임워크는 랜섬웨어를 초월해 데이터 泄露 백도어와 같은 다른 악성 소프트웨어 유형으로 일반화될 수 있는가?

주요 결과

  • RansomAI는 라즈베리 파이 4에 배포된 결과, 2분 이내에 90% 이상의 탐지 회피 정확도를 달성했다.
  • 에이전트는 훈련 6.5분 만에 최적 설정 선택 정확도 96.32%를 달성했다.
  • Log-SiLU 활성화 함수 조합이 학습 속도와 정확도 사이의 최적 균형을 이룩했으며, 훈련 시간 139.4분, 정확도 99.24%를 기록했다.
  • Xavier 가중치 초기화 방법이 테스트된 초기화 방법들 중에서 가장 빠른 수렴 속도(105.4분)와 가장 높은 정확도(99.31%)를 기록했다.
  • 에이전트는 5,000 에피소드 후 99.71%의 정확도를 달성하여 장기적 학습 안정성과 강건성을 입증했다.
  • 프레임워크는 AI 기반 랜섬웨어가 적응형 암호화 전략을 학습함으로써 현대의 행동 기반 탐지 시스템을 효과적으로 회피할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.