[논문 리뷰] Generic Black-Box End-to-End Attack Against State of the Art API Call Based Malware Classifiers
이 논문은 기능을 변경하지 않으면서 악성 소프트웨어 바이너리의 수정된 API 호출 시퀀스와 정적 특성(예: 인쇄 가능한 문자열)을 생성하는 일반적인 블랙박스 대비 공격을 제시한다. 이 공격은 최신 기계학습 기반 악성 소프트웨어 분류기들을 기능을 유지하면서 회피할 수 있으며, RNN, DNN 및 SVM과 같은 전통적 분류기들 사이에서 높은 전이성(transferability)을 보이며 하이브리드 모델에서 82.27%의 효과성을 보였다. 이는 소스 코드 접근 없이도 종단 간 회피가 가능한 GADGET 프레임워크를 통해 구현되었다.
In this paper, we present a black-box attack against API call based machine learning malware classifiers, focusing on generating adversarial sequences combining API calls and static features (e.g., printable strings) that will be misclassified by the classifier without affecting the malware functionality. We show that this attack is effective against many classifiers due to the transferability principle between RNN variants, feed forward DNNs, and traditional machine learning classifiers such as SVM. We also implement GADGET, a software framework to convert any malware binary to a binary undetected by malware classifiers, using the proposed attack, without access to the malware source code.
연구 동기 및 목표
- 소스 코드 접근 없이도 현대의 API 호출 기반 악성 소프트웨어 분류기를 종단 간 효과적으로 회피할 수 있는 실용적인 블랙박스 공격을 개발하는 것.
- RNN, DNN 및 SVM, 랜덤 포레스트와 같은 전통적 머신러닝 모델을 포함한 다양한 분류기 아키텍처 간에 악성 예외의 전이성을 입증하는 것.
- 동적(예: API 시퀀스) 및 정적(예: 문자열) 특성을 조합한 다중 특성 기반 분류기로의 공격 확장을 통해 실제 검출 시스템을 반영하는 것.
- 50만 개의 악성 및 정상 샘플로 구성된 대규모 데이터셋을 활용해 다양한 분류기 유형에 대해 공격의 효과성을 검증하는 것.
- 입력된 바이너리에서 소스 코드 없이도 기능적으로 손상되지 않은 악성 예외 바이너리를 자동으로 생성하는 GADGET 프레임워크의 구현 및 평가
제안 방법
- 공격은 데이터셋의 대표적 부분집합에 대해 훈련된 서rogate 모델을 사용하여 악성 예외 편향을 생성하며, 기능성과 의미를 유지하면서 API 호출 시퀀스와 인쇄 가능한 문자열을 수정하기 위해 기울기 기반 최적화를 활용한다.
- API 시퀀스 공격의 경우, 의미를 유지하면서도 기능성을 보존하는 조건에서 원-핫 인코딩된 API 시퀀스에 기울기 기반 편향을 적용한다.
- 정적 특성 공격의 경우, 서rogate 모델의 기울기 추정치를 활용해 바이너리에 문자열을 선택하고 추가함으로써 최종 샘플이 악성임을 유지하면서도 탐지되지 않도록 보장한다.
- 통합 공격은 동적 및 정적 특성을 동시에 수정하며, 하이브리드 분류기를 대상으로 하여 원본 모델에서의 회피를 검증한다.
- GADGET는 공격 파이프라인을 통합하여 IAT 패치 또는 새로운 섹션을 통해 바이너리에 수정된 특성(예: 문자열)을 삽입함으로써 실행을 방해하지 않도록 한다.
- 이 방법은 전이성 원칙에 기반한다: 서rogate 모델에 대해 제작된 악성 예외는 실제 블랙박스 분류기 역시 성공적으로 회피한다.
실험 결과
연구 질문
- RQ1다양한 아키텍처, 특히 RNN, DNN 및 전통적 머신러닝 모델(예: SVM)을 포함한 최신 API 기반 악성 소프트웨어 분류기들을 효과적으로 블랙박스 공격으로 회피할 수 있는가?
- RQ2하이브리드 분류기에서 정적 특성(예: 인쇄 가능한 문자열)을 포함함으로써 타겟 공격의 효과성이 어느 정도 감소하는가?
- RQ3소스 코드 접근 없이도 실제 악성 소프트웨어 바이너리에 대해 종단 간 기능을 유지하면서 악성 예외 편향을 생성할 수 있는가?
- RQ4실제 시스템에서 사용되는 동적 및 정적 특성을 조합한 다중 특성 기반 분류기에서 공격의 효과성은 어떠한가?
- RQ5서rogate 모델에서 생성된 악성 예외의 전이성이 랜덤 포레스트와 같은 RNN 이외의 아키텍처와 다양한 RNN 변종에 걸쳐 악성 소프트웨어 검출 맥락에서 유효하고 일관된가?
주요 결과
- 동적 특성(예: API 시퀀스) 전용으로 훈련된 분류기에서 96.03%의 효과성을 기록하여 전문화된 모델에 대해 높은 성공률을 입증하였다.
- 동적 및 정적 특성을 조합한 하이브리드 분류기를 대상으로 할 경우 82.27%의 효과성을 유지하여 다중 특성 기반 방어에 대한 강건성을 보였다.
- 문자열 전용 공격은 하이브리드 모델에서 68.66%의 효과성을 기록했고, 정적 특성 전용 분류기에서는 77.33%의 효과성을 기록하여 하이브리드 모델이 부분적으로 방어 효과를 발휘함을 시사했다.
- LSTM, GRU, 피드포워드 DNN, 1D CNN, SVM, 랜덤 포레스트, 로지스틱 회귀, GBDT 등 다양한 분류기 유형에서 공격이 효과적이었으며, 광범위한 전이성을 확인하였다.
- GADGET 프레임워크는 소스 코드 없이도 바이너리에 수정된 특성을 삽입함으로써 기능적으로 손상되지 않은 악성 예외 바이너리를 성공적으로 생성하여 종단 간 구현 가능성의 증명하였다.
- 이 연구는 사이버 보안 분야에서 처음으로, 서rogate 모델에 대해 제작된 악성 예외가 실제 블랙박스 악성 소프트웨어 분류기를 고도로 신뢰성 있게 회피할 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.