[논문 리뷰] SAFE-PDF: Robust Detection of JavaScript PDF Malware Using Abstract Interpretation
이 논문은 보수적인 추상 해석을 사용하여 JavaScript 기반 PDF 악성 소프트웨어를 탐지하는 강력한 정적 분석 프레임워크인 SAFE-PDF를 제안한다. PDF JavaScript 환경을 모델링하고 화이트리스트 정책을 적용함으로써, SAFE-PDF는 높은 리콜을 달성하며 일반적인 회피 기법인 오브스큐레이션, 악성 소프트웨어 모방, 샌드박스 탐지 등을 저지한다. 이는 정밀도는 유사한 수준을 유지하면서도 평균 문서 분석 시간이 4초 미만인 최신 기술 수준의 도구들을 능가하는 내구성을 보인다.
The popularity of the PDF format and the rich JavaScript environment that PDF viewers offer make PDF documents an attractive attack vector for malware developers. PDF documents present a serious threat to the security of organizations because most users are unsuspecting of them and thus likely to open documents from untrusted sources. We propose to identify malicious PDFs by using conservative abstract interpretation to statically reason about the behavior of the embedded JavaScript code. Currently, state-of-the-art tools either: (1) statically identify PDF malware based on structural similarity to known malicious samples; or (2) dynamically execute the code to detect malicious behavior. These two approaches are subject to evasion attacks that mimic the structure of benign documents or do not exhibit their malicious behavior when being analyzed dynamically. In contrast, abstract interpretation is oblivious to both types of evasions. A comparison with two state-of-the-art PDF malware detection tools shows that our conservative abstract interpretation approach achieves similar accuracy, while being more resilient to evasion attacks.
연구 동기 및 목표
- PDF 뷰어 및 JavaScript 런타임의 취약점을 악용하는 증가하는 JavaScript 기반 PDF 악성 소프트웨어의 위협을 해결하기 위해.
- 기존 탐지 도구의 한계를 극복하기 위해, 코드 오브스큐레이션, 양호한 구조를 모방하는 방식, 샌드박스 탐지 등으로 인한 회피 기법을 고려하기 위해.
- 기존 도구들이 실패하는 경우에도 작동하는 실용적이고 고리콜 정적 분석 시스템을 개발하기 위해, PDF에 내장된 JavaScript를 대상으로 한다.
- 기존 도구들이 망가지는 극단적인 케이스나 비표준 구조를 처리할 수 있는 강력한 PDF JavaScript 코드 추출기 설계를 위해.
- 투명하고 유지보수가 쉬운 탐지 모델을 제공하기 위해, 추상 해석과 화이트리스트 정책 기반의 모델을 설계하여 암묵적인 머신러닝 기반 분류기 의존도를 피하기 위해.
제안 방법
- PDF에 내장된 JavaScript의 모든 가능한 동작을 안전하게 초과 근사하는 보수적인 추상 해석을 사용하여 분석한다.
- PDF JavaScript 환경에 특화된 도메인 전용 추상 기계를 설계하여 일반적인 API 및 실행 컨텍스트를 지원한다.
- 힙 스프레잉 및 취약한 함수 호출과 같은 알려진 악성 패tern을 차단하는 화이트리스트 정책을 구현한다.
- 기존 추출기에서 실패한 2,952개의 문제 있는 PDF 문서를 대상으로 검증된 매우 강력한 JavaScript 코드 추출기를 구축한다.
- 모든 알 수 없는 또는 잠재적으로 악성인 동작은 악성으로 간주하여 리콜을 극대화하는 보수적인 분석 전략을 사용한다.
- 동적 실행 없이도 다양한 뷰어 버전과 환경에서의 동작을 시뮬레이션하기 위해 기호적 추론을 통합한다.
실험 결과
연구 질문
- RQ1추상 해석이 고리콜과 낮은 거짓 양성률을 달성하는 JavaScript 기반 PDF 악성 소프트웨어 탐지에 효과적으로 적용될 수 있는가?
- RQ2정적 분석 접근법이 코드 오브스큐레이션, 양호한 구조의 모방, 샌드박스 탐지와 같은 일반적인 회피 기법에 저항할 수 있는가?
- RQ3추상 해석 기반 탐지의 성능와 정확도는 최신 기술 수준의 시그니처 기반 및 동적 분석 도구와 비교해 어떻게 되는가?
- RQ4강력한 코드 추출기가 손상되거나 비표준 PDF 구조를 포함한 문서가 있는 상황에서 정적 분석의 신뢰성을 얼마나 향상시킬 수 있는가?
- RQ5투명하고 정책 기반의 모델이 유지보수성과 회피에 대한 저항성 측면에서 암묵적인 머신러닝 기반 탐지기보다 뛰어나게 성능을 낼 수 있는가?
주요 결과
- SAFE-PDF는 평가 세트에 포함된 거의 모든 알려진 악성 PDF를 탐지하여 거의 완벽한 리콜을 달성한다.
- 보수적인 분석 전략에도 불구하고, 최신 기술 수준의 탐지 도구와 유사한 정밀도를 유지한다.
- 문서당 평균 분석 시간이 4초 이내로, 실세계 배포에 대한 실용성을 입증한다.
- 기존 추출기에서 실패했던 2,952개의 문서를 성공적으로 처리함으로써, 파서 혼동 공격에 대한 강건성을 입증한다.
- 정적, 보수적, 의미 기반 분석 덕분에 오브스큐레이션, 모방, 샌드박스 회피 공격을 효과적으로 저지한다.
- 사용자 상호작용에 의해 유발되는 동작을 탐지함으로써, 샌드박스 기반 도구들이 놓치는 동작을 탐지함으로써 동적 분석을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.