Skip to main content
QUICK REVIEW

[논문 리뷰] Realizable Universal Adversarial Perturbations for Malware

Raphael Labaca-Castro, Luis Muñoz-González|arXiv (Cornell University)|2021. 02. 12.
Advanced Malware Detection Techniques인용 수 6
한 줄 요약

이 논문은 악성 기능을 유지하면서 기계학습 기반 악성 소프트웨어 검출기의 탐지를 피할 수 있도록 하는 실현 가능한 보편적 적대적 편향(UAPs)을 생성하기 위한 새로운 방법을 제안한다. 문제 공간 변환을 적용함으로써 실현 가능한 UAPs를 생성한다. 이는 안드로이드 및 윈도우 악성 소프트웨어 전반에서 매우 효과적이며, 백색 상자 공격에서 약 20%의 탈출률을 기록하면서 정상 악성 소프트웨어 탐지에 미치는 영향은 최소화한다. 또한 문제 공간 인식 기반의 적대적 훈련 방어 기법을 제안하여 이러한 공격에 대한 모델의 강화 비용을 크게 감소시킨다.

ABSTRACT

Machine learning classifiers are vulnerable to adversarial examples -- input-specific perturbations that manipulate models' output. Universal Adversarial Perturbations (UAPs), which identify noisy patterns that generalize across the input space, allow the attacker to greatly scale up the generation of such examples. Although UAPs have been explored in application domains beyond computer vision, little is known about their properties and implications in the specific context of realizable attacks, such as malware, where attackers must satisfy challenging problem-space constraints. In this paper we explore the challenges and strengths of UAPs in the context of malware classification. We generate sequences of problem-space transformations that induce UAPs in the corresponding feature-space embedding and evaluate their effectiveness across different malware domains. Additionally, we propose adversarial training-based mitigations using knowledge derived from the problem-space transformations, and compare against alternative feature-space defenses. Our experiments limit the effectiveness of a white box Android evasion attack to ~20% at the cost of ~3% TPR at 1% FPR. We additionally show how our method can be adapted to more restrictive domains such as Windows malware. We observe that while adversarial training in the feature space must deal with large and often unconstrained regions, UAPs in the problem space identify specific vulnerabilities that allow us to harden a classifier more effectively, shifting the challenges and associated cost of identifying new universal adversarial transformations back to the attacker.

연구 동기 및 목표

  • 실제 악성 소프트웨어의 문제 공간에서, 편향가지가 악성 기능을 유지하면서도 타당성을 갖는다는 조건 하에 보편적 적대적 편향(UAPs)의 실현 가능성과 효과성을 조사하는 것.
  • 기능 공간에 UAPs를 유도할 수 있도록 문제 공간 변환의 짧은 시퀀스를 생성하는 근시적 알고리즘을 개발하여, 기계학습 기반 악성 소프트웨어 검출기의 확장 가능한 탈출을 가능하게 하는 것.
  • 다양한 분류기(예: LR, SVM, DNN, LightGBM)가 안드로이드 및 윈도우 악성 소프트웨어 데이터셋에서 UAP 공격에 얼마나 견딜 수 있는지 평가하는 것.
  • 문제 공간에 의해 유도된 UAPs를 사용하는 새로운 적대적 훈련 방어 기법을 제안하고 검증하여, 광범위한 적대적 예제 생성이 필요로 하는 양을 줄이는 것.
  • 기존의 변환 툴킷에 대한 모델 강화를 통해 공격자의 비용을 높여, 대규모 탈출이 더 이상 실현 가능하지 않게 만드는 것.

제안 방법

  • 근시적 알고리즘을 사용하여, 기능 공간 임베딩에 UAPs를 유도할 수 있는 문제 공간 변환(예: 코드 오버플루션, API 재정렬 등)의 짧은 시퀀스를 식별한다.
  • 이러한 변환을 기능 공간의 편향로 매핑하여, 여러 악성 소프트웨어 샘플에 걸쳐 일반화되는 방식으로 보편적 탈출을 가능하게 한다.
  • 기능 공간 노이즈가 아닌 문제 공간 변환 파이프라인을 통해 생성된 훼손된 악성 소프트웨어 샘플을 사용하여 적대적 훈련을 수행한다.
  • 정상 악성 소프트웨어 탐지에 미치는 영향을 최소화하기 위해, 1%의 거짓 경고 비율(FPR)에서 진짜 양성 비율(TPR)의 감소를 측정하여 방어 성능을 평가한다.
  • DNN 및 LightGBM를 포함한 다양한 분류기를 사용하여 안드로이드(DREBIN, MaMaDroid 등) 및 윈도우 악성 소프트웨어 데이터셋에서 이 방법을 검증한다.
  • 다양한 모델 간 UAP의 이동성(transferability)을 분석하여, 다양한 아키텍처에서 비슷한 취약성을 보이는 것으로 나타났다.

실험 결과

연구 질문

  • RQ1실제 악성 소프트웨어의 문제 공간에서 악성 기능을 유지하면서도 보편적 적대적 편향(UAPs)을 효과적으로 생성하고 적용할 수 있는가?
  • RQ2기능 공간에서의 입력 특화 공격과 비교해 볼 때, 악성 소프트웨어 분류 모델에 대한 UAP의 효과성은 어떠한가?
  • RQ3기능 공간 UAPs를 기반으로 한 적대적 훈련이 기능 공간 적대적 훈련에 비해 모델의 강건성 향상에 얼마나 기여하는가?
  • RQ4제안된 방어 기법은 얼마나 많은 탈출 샘플이 필요한지 줄이고, 정상 악성 소프트웨어 탐지에 어떤 영향을 미치는가?
  • RQ5제안된 방법론은 안드로이드 및 윈도우와 같은 다양한 악성 소프트웨어 패밀리와 운영 체제로 일반화될 수 있는가?

주요 결과

  • 기능 공간의 UAPs는 입력 특화 공격과 유사한 탈출률을 기록하여, 기계학습 기반 악성 소프트웨어 검출기의 체계적 취약성을 입증한다.
  • 제안된 근시적 변환 파이프라인은 다양한 악성 소프트웨어 패밀리에서 탐지 회피 가능성이 매우 높은 기능적인 적대적 악성 소프트웨어를 성공적으로 생성한다.
  • 백색 상자 탈출 공격에서 1% FPR에서 약 20%의 탈출률을 기록하면서도 TPR 감소율이 약 3%에 그쳐, 매우 높은 공격 효율성과 동시에 낮은 탐지 비용을 보여준다.
  • 문제 공간에 의해 유도된 UAPs를 사용한 적대적 훈련은 기능 공간 노이즈를 사용한 적대적 훈련보다 실현 가능한 UAP 공격에 대한 방어에 더 효과적이다.
  • 로지스틱 회귀 및 SVM과 같은 선형 모델에 비해 DNN 및 LightGBM과 같은 비선형 모델이 문제 공간 UAPs에 더 강건함을 보였다.
  • 기존의 변환 툴킷에 대한 모델 강화를 통해 공격자의 비용을 높여, 새로운 탈출 기법을 만드는 데 더 많은 자원과 시간이 소요되도록 하여 공격의 비용을 뒤로 돌린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.