Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Malware Detection Accuracy by Extracting Icon Information

Pedro Silva, Sepehr Akhavan-Masouleh|arXiv (Cornell University)|2017. 12. 10.
Advanced Malware Detection Techniques참고 문헌 17인용 수 3
한 줄 요약

이 논문은 기계학습 모델의 정확도를 향상시키기 위해 포터블 실행 파일(PE) 내의 아이콘 특징을 추출하고 군집화하는 방식으로 악성코드 탐지 성능을 향상시키는 방법을 제안한다. 수작업으로 설계한 특징, 기울기 히스토GRAM(HOG), 그리고 컨volutional autoencoder를 결합하여 아이콘에서 총 1,114개의 특징을 추출한 후, 이를 하나의 정보가 풍부한 특징으로 군집화한다. 실험 결과, 예측 모델에 아이콘 군집 정보를 포함시킬 경우 악성코드 탐지 정확도가 평균 10% 향상됨을 확인하였다.

ABSTRACT

Detecting PE malware files is now commonly approached using statistical and machine learning models. While these models commonly use features extracted from the structure of PE files, we propose that icons from these files can also help better predict malware. We propose an innovative machine learning approach to extract information from icons. Our proposed approach consists of two steps: 1) extracting icon features using summary statics, histogram of gradients (HOG), and a convolutional autoencoder, 2) clustering icons based on the extracted icon features. Using publicly available data and by using machine learning experiments, we show our proposed icon clusters significantly boost the efficacy of malware prediction models. In particular, our experiments show an average accuracy increase of 10% when icon clusters are used in the prediction model.

연구 동기 및 목표

  • 악성 패턴을 드러낼 수 있는 잠재력이 있음에도 불구하고, PE 파일 악성코드 탐지에서 아이콘 메타데이터가 여전히 미흡하게 활용되고 있는 문제를 해결하기 위해.
  • 악성코드가 탐지를 피하기 위해 사용하는 미세한 변형에 취약한 원시 픽셀 기반 아이콘 분석의 한계를 극복하기 위해.
  • 일반적인 아이콘 가로막기 기법(예: 흐림, 색상 이동 등)에 저항하면서도 의미 있는 시각적 정보를 유지하는 강력한 특징 추출 파이프라인을 개발하기 위해.
  • 아이콘 군집화가 기계학습 기반 악성코드 분류기의 성능을 향상시키는 데 효과적인 저차원 특징으로 기능할 수 있음을 입증하기 위해.
  • 공개된 데이터셋을 사용하고 다양한 분류 모델을 적용하여 철저한 실험을 통해 아이콘 기반 특징의 유효성을 검증하기 위해.

제안 방법

  • 수작업으로 설계한(MC) 특징(레드,绿色通道 및 영역 기반 평균과 표준편차), 기울기 히스토GRAM(HOG)을 통한 형태 및 질감 특징, 컨volutional autoencoder를 통한 딥 러닝 기반 특징 추출을 조합하여 아이콘의 특징을 추출한다.
  • 각 아이콘에 대해 추출된 1,114개 특징을 통합하여, 미세한 왜곡에 대해 강건한 시각적 특성 표현을 위한 통합 특징 벡터를 구성한다.
  • 통합 특징 벡터에 k-means 군집화를 적용하여 시각적으로 유사한 아이콘을 이산적인 군집으로 묶고, 파일당 하나의 범주형 특징으로 차원을 감소시킨다.
  • 결과로 도출된 아이콘 군집 ID를 기존 기계학습 모델(로지스틱 회귀(L1/L2 정규화 포함) 및 선형 SVM)에 새로운 특징으로 통합한다.
  • 과적합을 방지하기 위해 정규화 강도 α를 최적화하기 위해 하이퍼파ram터 튜닝을 수행하고, 전략적 4등분 교차검증을 실시한다.
  • 정확도, 참양성비율(TPR), 참음성비율(TNR), AUC와 같은 표준 지표를 사용하여 보류된 테스트 세트에서 모델 성능을 평가하며, 표준 오차를 통한 통계적 유의성 분석을 실시한다.

실험 결과

연구 질문

  • RQ1PE 파일에서 추출한 아이콘 특징은 기계학습 기반 악성코드 탐지 모델의 정확도를 향상시킬 수 있는가?
  • RQ2수작업 특징, HOG, 오토인코더를 조합한 특징 추출 기법은 일반적인 가로막기 기법에 저항하면서도 아이콘의 의미 있는 시각적 패턴을 효과적으로 포착할 수 있는가?
  • RQ3아이콘 특징을 의미 있는 그룹으로 군집화하면, 원시 특징이나 아이콘 정보 없이 사용하는 것에 비해 악성코드 탐지 모델의 예측 능력을 향상시킬 수 있는가?
  • RQ4아이콘 군집 정보의 포함 여부가 다양한 분류기(예: 로지스틱 회귀, SVM)와 평가 지표(예: AUC, TPR, TNR)에서 모델 성능 향상에 얼마나 기여하는가?
  • RQ5악성코드 탐지 정확도 향상은 다양한 모델 아키텍처와 평가 프로토콜에서 통계적으로 유의미하고 일관된가?

주요 결과

  • 아이콘 군집 특징을 포함시킨 결과, 아이콘 특징이 없는 모델 대비 악성코드 예측 모델의 평균 탐지 정확도가 10% 향상되었다.
  • 테스트된 세 가지 모델(Lasso 로지스틱 회귀(LR L1), 릿지 로지스틱 회귀(LR L2), 선형 SVM) 모두 아이콘 군집 ID를 추가함으로써 테스트 정확도, AUC, TPR, TNR에서 일관된 향상을 보였다.
  • 가장 높은 성능을 보인 모델(LR L1 + 아이콘 군집)은 테스트 정확도 84.4%, TPR 80.2%, TNR 88.6%, AUC 0.918를 기록했으며, 아이콘 특징이 없는 동일한 모델 대비 뚜렷한 우월성을 보였다.
  • 그림 4의 ROC 곡선은 아이콘 군집 특징이 포함된 모델과 포함되지 않은 모델 간의 명확한 분리가 이루어졌음을 보여주며, 향상 효과의 강건성과 일관성을 확인한다.
  • 교차검증 및 테스트 세트 결과는 과적합의 영향이 아니며, 정규화와 전략적 샘플링을 통해 일반화 능력이 확보되었음을 시사한다.
  • 일반적으로 忽시되는 아이콘 정보는 적절히 추출하고 군집화될 경우, 악성코드 탐지에 매우 관련성 있고 구분력 있는 의미 있는 패턴을 담고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.