[논문 리뷰] Adversarial Attacks on Transformers-Based Malware Detectors
이 논문은 Fast Gradient Sign Method (FGSM)를 적용하여 Transformer 기반 악성코드 검출기의 적대적 취약성을 조사하며, 변형된 악성코드 샘플을 생성하여 23.9%의 잘못 분류 비율을 달성한다. 적대적 훈련과 특징 공간 축소를 통해 방어 전략을 제안하였으며, 잘못 분류 비율을 각각 11.2%와 21.5%로 낮추어 최신 기술 모델이 회피 공격에 매우 취약하다는 것을 입증한다.
Signature-based malware detectors have proven to be insufficient as even a small change in malignant executable code can bypass these signature-based detectors. Many machine learning-based models have been proposed to efficiently detect a wide variety of malware. Many of these models are found to be susceptible to adversarial attacks - attacks that work by generating intentionally designed inputs that can force these models to misclassify. Our work aims to explore vulnerabilities in the current state of the art malware detectors to adversarial attacks. We train a Transformers-based malware detector, carry out adversarial attacks resulting in a misclassification rate of 23.9% and propose defenses that reduce this misclassification rate to half. An implementation of our work can be found at https://github.com/yashjakhotiya/Adversarial-Attacks-On-Transformers.
연구 동기 및 목표
- 최신 기술의 Transformer 기반 악성코드 검출기의 적대적 공격에 대한 취약성을 평가하기 위해.
- 악성코드 검출 시스템에서의 회피 공격에 대비한 다양한 방어 기법의 효과성을 평가하기 위해.
- 심지어 최신 딥러닝 모델인 Transformer조차도 악성코드 바이너리의 소량의 정밀한 변형에 취약하다는 것을 입증하기 위해.
- 악성코드 검출 모델을 위한 적대적 공격 및 방어의 실용적 구현을 제공하기 위해.
제안 방법
- PE 파일에서 추출한 디어셈블된 어셈블리 코드와 정적 특징을 사용하여 Transformer 기반 악성코드 검출기를 훈련시켰다.
- 입력 특징에 소량의 정밀한 변형을 더하여 적대적 샘플을 생성하기 위해 Fast Gradient Sign Method (FGSM)를 적용하였다.
- 잘못 분류 확률을 극대화하기 위해 대상 클래스 레이블을 사용하여 타겟 기반 FGSM를 사용하였다.
- 적대적 예시로 모델을 재학습시켜 강건성을 향상시키기 위해 적대적 훈련을 구현하였다.
- 변형 가능성을 제한하기 위해 특징 공간을 축소시켰다.
- 적대적 입력에 대한 잘못 분류 비율을 측정하여 방어 성능을 평가하였다.
실험 결과
연구 질문
- RQ1적대적 공격가 최신 기술의 Transformer 기반 악성코드 검출기를 성공적으로 우회할 수 있는가?
- RQ2FGSM가 검출을 회피하는 적대적 악성코드 샘플을 생성하는 데 얼마나 효과적인가?
- RQ3다양한 방어 전략—적대적 훈련과 특징 공간 축소—는 모델의 강건성에 어떤 영향을 미치는가?
- RQ4특징 공간 축소는 얼마나 회피 공격의 영향을 줄일 수 있는가?
주요 결과
- FGSM 기반의 적대적 공격는 Transformer 기반 악성코드 검출기에서 잘못 분류 비율이 23.9%에 달했다.
- 적대적 훈련은 잘못 분류 비율을 11.2%로 낮춰 강건성 향상에 상당한 기여를 했다.
- 특징 공간 축소는 강건성 향상에 약간의 기여만 했으며, 잘못 분류 비율을 21.5%로 낮추었다.
- 결과적으로 심지어 최신 딥러닝 모델인 Transformer조차도 소량의 입력 변형을 통한 회피 공격에 취약하다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.