[논문 리뷰] MLPdf: An Effective Machine Learning Based Approach for PDF Malware Detection
이 논문은 약 105,000개의 실제 PDF 파일에서 추출한 48개의 고품질 특징을 사용하여 PDF 기반 악성 소프트웨어를 탐지하는 다층 퍼셉트론(Multilayer Perceptron, MLP) 신경망 모델인 MLPdf를 제안한다. 이 모델은 오직 0.08%의 가짜 양성률을 기록하면서도 95.12%의 참 양성률을 달성하여, 여덟 대의 상용 악성코드 스캐너보다 뚜렷이 뛰어난 성능을 보였다.
Due to the popularity of portable document format (PDF) and increasing number of vulnerabilities in major PDF viewer applications, malware writers continue to use it to deliver malware via web downloads, email attachments and other methods in both targeted and non-targeted attacks. The topic on how to effectively block malicious PDF documents has received huge research interests in both cyber security industry and academia with no sign of slowing down. In this paper, we propose a novel approach based on a multilayer perceptron (MLP) neural network model, termed MLPdf, for the detection of PDF based malware. More specifically, the MLPdf model uses a backpropagation algorithm with stochastic gradient decent search for model update. A group of high quality features are extracted from two real-world datasets which comprise around 105000 benign and malicious PDF documents. Evaluation results indicate that the proposed MLPdf approach exhibits excellent performance which significantly outperforms all evaluated eight well known commercial anti-virus scanners with a much higher true positive rate of 95.12% achieved while maintaining a very low false positive rate of 0.08%.
연구 동기 및 목표
- 사용자 친화적인 PDF 뷰어에서 사회공학 기법과 제로데이 공격을 통해 퍼지는 PDF 기반 악성코드의 증가하는 위협을 해결하기 위해.
- 오염, 다형성, 제로데이 공격에 취약한 전통적인 서명 기반 및 샌드박스 기반 탐지 방법의 한계를 극복하기 위해.
- 매우 높은 참 양성률을 유지하면서도 매우 낮은 가짜 양성률을 확보할 수 있는 기계학습 모델을 개발하기 위해.
- 실제 환경 조건에서 최신 기술 수준의 상용 악성코드 방지 스캐너와의 성능을 평가하기 위해.
제안 방법
- MLPdf 모델은 두 개의 은닉층 각각 72개의 뉴런을 가지며, 이진 분류(악성/정상)를 위한 단일 시그모이드 출력층을 갖는 다층 퍼셉트론 아키텍처를 사용한다.
- 모델 학습은 확률적 경사 하강법을 사용하며, 과적합을 방지하기 위해 드롭아웃 비율을 0.15로 설정한다.
- 각 레이어에 배치 정규화를 적용하여 입력의 평균을 0으로, 분산을 1로 유지함으로써 학습의 안정성과 속도를 향상시킨다.
- 과적합 여부를 모니터링하고 하이퍼파라미터 선택을 안내하기 위해 학습 데이터의 20%를 검증 세트로 활용한다.
- 약 105,000개의 정상 및 악성 PDF로 구성된 데이터셋을 대상으로 배치 크기가 64인 5,000 에포크 동안 학습을 수행한다.
- 탐지 성능을 균형 있게 유지하기 위해 확률 임계값을 0.62로 설정하였다.
실험 결과
연구 질문
- RQ1다층 퍼셉트론 기반 기계학습 모델이 상용 악성코드 방지 스캐너보다 더 높은 정확도로 악성 PDF를 효과적으로 탐지할 수 있는가?
- RQ2오염되거나 제로데이 기반의 PDF 기반 악성코드를 탐지할 때 MLPdf 모델의 참 양성률과 가짜 양성률은 어떻게 되는가?
- RQ3수동으로 선택한 고품질 특징 48개는 히ュ리스틱 또는 서명 기반 방법에 비해 탐지 성능 향상에 얼마나 기여하는가?
- RQ4MLP 아키텍처에서 드롭아웃과 배치 정규화를 사용할 경우, 미리 보지 못한 PDF 샘플에 대한 일반화 능력과 내구성이 향상되는가?
주요 결과
- MLPdf 모델은 정상 파일 13,101개와 악성 파일 1,946개로 구성된 테스트 세트에서 95.12%의 참 양성률을 기록하였으며, 최고의 상용 악성코드 스캐너가 기록한 84.53%보다 뚜렷이 뛰어나다.
- 모델은 매우 낮은 가짜 양성률 0.08%를 유지하였으며, 이는 13,101개의 정상 파일 중 약 10.4개의 잘못 탐지된 경우에 해당한다.
- 가짜 양성률이 0.1%일 경우, 모델은 참 양성률 95%를 달성하여 중간 수준의 가짜 양성률 제약 조건에서도 뛰어난 성능을 보였다.
- 모델의 성능은 다양한 확률 임계값에서도 안정적이었으며, 가짜 양성률과 참 음성률 사이에 명확한 트레이드오프 관계가 존재했다.
- 그림 6에 나타나 있듯이, 모든 테스트 임계값에서 평가된 여덟 대의 상용 악성코드 방지 스캐너보다 MLPdf 접근 방식이 뚜렷이 뛰어난 성능을 보였다.
- 48개의 고품질 특징과 함께 배치 정규화 및 드롭아웃을 사용함으로써, 모델의 뛨어진 일반화 능력과 낮은 과적합 수준이 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.