Skip to main content
QUICK REVIEW

[논문 리뷰] MAB-Malware: A Reinforcement Learning Framework for Attacking Static Malware Classifiers

Wei Song, Xuezixiang Li|arXiv (Cornell University)|2020. 03. 06.
Advanced Malware Detection Techniques참고 문헌 53인용 수 22
한 줄 요약

MAB-Malware는 악성 소프트웨어 공격 생성을 다중 손잡이 띠 문제로 모델링하는 블랙박스 강화학습 프레임워크를 제안한다. 이는 탐지율을 극대화하기 위해 탐색과 이용을 최적화한다. 최신 기계학습 기반 검출기에서는 74%~97%의 탐지 회피율을 달성하고, 상용 방화벽에서는 32%~48%의 탐지 회피율을 기록한다. 이는 페이로드 변경을 최소화하고 성공한 페이로드를 재사용하여 정적 악성 소프트웨어 분류기 대상으로 효과적이고 해석 가능한 공격을 가능하게 한다.

ABSTRACT

Modern commercial antivirus systems increasingly rely on machine learning to keep up with the rampant inflation of new malware. However, it is well-known that machine learning models are vulnerable to adversarial examples (AEs). Previous works have shown that ML malware classifiers are fragile to the white-box adversarial attacks. However, ML models used in commercial antivirus products are usually not available to attackers and only return hard classification labels. Therefore, it is more practical to evaluate the robustness of ML models and real-world AVs in a pure black-box manner. We propose a black-box Reinforcement Learning (RL) based framework to generate AEs for PE malware classifiers and AV engines. It regards the adversarial attack problem as a multi-armed bandit problem, which finds an optimal balance between exploiting the successful patterns and exploring more varieties. Compared to other frameworks, our improvements lie in three points. 1) Limiting the exploration space by modeling the generation process as a stateless process to avoid combination explosions. 2) Due to the critical role of payload in AE generation, we design to reuse the successful payload in modeling. 3) Minimizing the changes on AE samples to correctly assign the rewards in RL learning. It also helps identify the root cause of evasions. As a result, our framework has much higher black-box evasion rates than other off-the-shelf frameworks. Results show it has over 74\%--97\% evasion rate for two state-of-the-art ML detectors and over 32\%--48\% evasion rate for commercial AVs in a pure black-box setting. We also demonstrate that the transferability of adversarial attacks among ML-based classifiers is higher than the attack transferability between purely ML-based and commercial AVs.

연구 동기 및 목표

  • 실제 상용 방화벽이 하드 레이블만 노출하므로, 정적 악성 소프트웨어 분류기 대상 실용적인 블랙박스 강화학습 기반 공격 프레임워크를 개발하는 것.
  • 기존 강화학습 기반 공격 프레임워크에서 상태 기반 모델링의 한계를 극복하기 위해 상태 없는 다중 손잡이 띠 접근 방식을 채택하여 검색 공간 복잡도를 감소시키는 것.
  • 성공한 페이로드를 재사용하고 기능적 변경을 최소화하여 기능 유지와 보상 신호의 명확성 향상을 통해 탐지 회피 성공률을 향상시키는 것.
  • 악성 소프트웨어가 방화벽 및 기계학습 기반 검출기를 회피하는 데 기여하는 핵심 행동과 기능을 식별함으로써 탐지 회피 분석의 해석 가능성을 보장하는 것.
  • 다양한 악성 소프트웨어 검출 시스템 간에 공격 예제의 이동성(트랜스퍼러빌리티)을 평가하는 것. 이는 상용 방화벽과 기계학습 기반 분류기를 포함한다.

제안 방법

  • 각 행동(예: 섹션 추가, 헤더 수정 등)을 확률적 보상이 있는 한 개의 손잡이로 간주하는 다중 손잡이 띠 문제로 악성 소프트웨어 공격 생성을 모델링한다.
  • 행동 간의 순서 의존성이 없고 상호 독립적이라는 가정 하에 상태 없는 행동 선택 메커니즘을 사용하여 조합 폭발을 방지한다.
  • 비효율적인 행동을 필터링하고 기능 유지에 최소한의 변경만을 허용하는 Action Minimization 모듈을 도입한다.
  • 이전 시도에서 성공한 페이로드 내용을 재사용하여 띠 설정에서 수렴 속도를 높이고 탐색 효율을 향상시킨다.
  • 분류 결과(탐지 회피 성공 여부)에 기반해 보상을 할당하며, 변화량을 최소화하여 의미 있는 보상 신호와 해석 가능성을 확보한다.
  • 관측된 성공에 기반해 새로운 행동(미리 알지 못한 내용 포함)을 동적으로 추가하여 사전에 공격 표면을 알지 못하더라도 적응형 탐색이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1기계학습 기반 악성 소프트웨어 검출기와 상용 방화벽 양쪽 모두에서 기존의 상용 제품 대비 뚜렷한 향상된 탐지 회피율을 달성할 수 있는가?
  • RQ2상태 없는 다중 손잡이 띠 설정은 상태 기반 강화학습 모델 대비 스케일러빌리티와 성능에서 어떻게 향상되는가?
  • RQ3성공한 페이로드를 재사용함으로써 효과적인 악성 소프트웨어 변형을 발견하는 데 얼마나 빠른 진전이 이루어지는가?
  • RQ4기능을 유지하면서 탐지 회피에 충분한 PE 파일의 최소 변경은 무엇이며, 어떤 기능이 회피에 가장 기여하는가?
  • RQ5악성 소프트웨어 공격 예제는 서로 다른 악성 소프트웨어 검출 시스템 간에 얼마나 이동성이 있는가? 특히 기계학습 기반 분류기와 상용 방화벽 간의 이동성에 초점한다.

주요 결과

  • MAB-Malware는 순수한 블랙박스 환경에서 두 개의 최신 기계학습 기반 악성 소프트웨어 검출기에서 74%~97%의 탐지 회피율을 달성한다.
  • 프레임워크는 여섯 대의 상용 방화벽 엔진에서 32%~48%의 탐지 회피율을 보이며, 이는 이전의 강화학습 기반 방법보다 뚜렷이 뛰어나다.
  • 상태 없는 띠 모델을 사용함으로써 학습 복잡도가 감소하고 상태 기반 강화학습 접근 방식 대비 더 빠른 수렴이 가능하다.
  • 성공한 페이로드 재사용과 기능 변경 최소화는 더 안정적이고 해석 가능한 악성 소프트웨어 공격 예제를 만들어내며, 회피 원인의 명확한 기여도를 제공한다.
  • 악성 소프트웨어 공격 예제는 기계학습 기반 분류기 간에 더 높은 이동성을 보이며, 기계학습 기반 모델과 상용 방화벽 간에는 이동성이 낮게 나타나, 아키텍처 및 탐지 메커니즘의 차이를 시사한다.
  • 프레임워크는 특정 섹션 추가나 헤더 수정과 같은 핵심 행동과 기능을 식별함으로써 탐지 회피 원인을 명확히 해석 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.