[논문 리뷰] On Training Robust PDF Malware Classifiers
이 논문은 서브트리 삽입 및 삭제에 대한 강건성을 보장하기 위해 PDF 트리 구조 거리 측도를 도입하여 PDF 악성코드 분류기의 검증 가능 강건성 훈련을 제안한다. 테스트 정확도 99.74%와 0.56%의 거짓 양성률을 유지하면서도 평균 검증 가능 강건 정확도 92.27%를 달성하여, 유한 및 무한 공격자 모두의 공격 비용을 크게 높인다.
Although state-of-the-art PDF malware classifiers can be trained with almost perfect test accuracy (99%) and extremely low false positive rate (under 0.1%), it has been shown that even a simple adversary can evade them. A practically useful malware classifier must be robust against evasion attacks. However, achieving such robustness is an extremely challenging task. In this paper, we take the first steps towards training robust PDF malware classifiers with verifiable robustness properties. For instance, a robustness property can enforce that no matter how many pages from benign documents are inserted into a PDF malware, the classifier must still classify it as malicious. We demonstrate how the worst-case behavior of a malware classifier with respect to specific robustness properties can be formally verified. Furthermore, we find that training classifiers that satisfy formally verified robustness properties can increase the evasion cost of unbounded (i.e., not bounded by the robustness properties) attackers by eliminating simple evasion attacks. Specifically, we propose a new distance metric that operates on the PDF tree structure and specify two classes of robustness properties including subtree insertions and deletions. We utilize state-of-the-art verifiably robust training method to build robust PDF malware classifiers. Our results show that, we can achieve 92.27% average verified robust accuracy over three properties, while maintaining 99.74% accuracy and 0.56% false positive rate. With simple robustness properties, our robust model maintains 7% higher robust accuracy than all the baseline models against unrestricted whitebox attacks. Moreover, the state-of-the-art and new adaptive evolutionary attackers need up to 10 times larger $L_0$ feature distance and 21 times more PDF basic mutations (e.g., inserting and deleting objects) to evade our robust model than the baselines.
연구 동기 및 목표
- 최신 기술의 PDF 악성코드 분류기들이 높은 정확도와 낮은 거짓 양성률을 보이지만 단순한 변형에도 쉽게 회피당하는 강건성의 심각한 격차를 해결하기 위해.
- 특정 악성 공격 변형(예: PDF 트리 서브트리 삽입 또는 삭제)에 대해 분류기의 최악의 행동을 공식적으로 제한하는 검증 가능한 강건성 성질을 개발하기 위해.
- 높은 정확도와 낮은 거짓 양성률을 유지하면서도 무한 공격자에 의한 회피 비용을 높이는 분류기 훈련을 위해.
- 검증 가능한 강건성 훈련이 지정된 강건성 제약 조건을 초월한 고도로 발전된 공격자에게도 공격의 난이도를 높임을 입증하기 위해.
제안 방법
- PDF 트리의 계층적 구조에 기반한 새로운 거리 측도를 도입하여 서브트리 삽입 및 삭제로 인한 의미적·구문적 변화를 정량화한다.
- 검증 가능한 강건성 성질의 두 유형을 정의한다: 서브트리 삽입 강건성과 삭제 강건성으로, 이러한 수정에도 분류기 출력이 악성으로 유지됨을 보장한다.
- 기호적 간격 분석 기반 최신 기술의 검증 가능 강건성 훈련 기법을 활용하여 강건성 범위를 공식적으로 검증한다.
- 기존 모델(예: 랜덤 포레스트 등)의 한계를 피하기 위해 검증 가능 강건성 훈련과 호환되는 신경망 아키텍처를 사용한다.
- 적응형 진화 공격 및 특징 공간 공격을 활용하여 강건성을 평가하며, 특히 훈련된 강건성 성질을 공격하는 데 특화된 공격도 포함한다.
- 공격자 비용을 $L_0$ 특징 거리와 모델을 회피하기 위해 필요한 PDF 기본 변형 수(예: 객체 삽입/삭제)로 정량화한다.
실험 결과
연구 질문
- RQ1PDF 악성코드 분류기의 구조적 수정(예: 서브트리 삽입 및 삭제)에 대해 검증 가능한 강건성 성질를 공식적으로 정의하고 강제 적용할 수 있는가?
- RQ2검증 가능한 강건성 성질을 갖는 훈련이 지정된 성질을 초월한 무한 공격자에 대해 공격 비용을 증가시키는가?
- RQ3표준 정확도나 거짓 양성률이 크게 떨어지지 않게 강건성 훈련을 달성할 수 있는가?
- RQ4제안된 방법은 특징 공간 및 애플리케이션 공간 공격 양쪽 모두에 대해 기준 모델과 비교해 얼마나 잘 저항하는가?
주요 결과
- 제안된 방법은 세 가지 강건성 성질에 대해 평균 92.27%의 검증 가능 강건 정확도를 달성하였으며, 테스트 정확도는 99.74%이고 거짓 양성률은 0.56%였다.
- 무제한 백박스 공격에 대해 강건 모델은 모든 기준 모델보다 7% 높은 강건 정확도를 유지하였다.
- 최신 기술의 적응형 공격자들이 강건 모델을 회피하기 위해 기존 기준 모델 대비 최대 10배 높은 $L_0$ 특징 거리와 21배 더 많은 PDF 기본 변형이 필요로 하였다.
- 이동 및 산산조각 내기 조합 공격는 Robust A+C+E 모델의 강건성 평가 정확도를 3주 후 44%로 떨어뜨려, 조기 수렴과 높은 회피 난이도를 시사하였다.
- Monotonic 100 및 Robust A+B 모델은 각각 1개와 263개의 공격 가능한 PDF만 생성하면 되어 공격에 대한 저항력이 뛰어나다는 것을 입증하였다.
- 결과는 검증 가능한 강건성 훈련이 지정된 제약 조건을 초월한 공격자에게도 회피 비용을 증가시킴으로써 효과적인 방어 수단임을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.