Skip to main content
QUICK REVIEW

[논문 리뷰] New Datasets for Dynamic Malware Classification

Berkant Düzgün, Aykut Çayır|arXiv (Cornell University)|2021. 11. 30.
Advanced Malware Detection Techniques참고 문헌 13인용 수 7
한 줄 요약

이 논문은 API 호출 기반 분석을 사용한 동적 악성코드 분류를 위해 두 가지 새로운 업데이트된 데이터셋—VirusSamples에서 9,795개의 샘플과 VirusShare에서 14,616개의 샘플—을 소개한다. 평형 및 비평형 버전에서 네 가지 기계학습 모델(SVM, XGBoost, Random Forest, Histogram-based Gradient Boosting)을 평가하여, 비평형 VirusSample 데이터셋에서 SVM이 94%의 정확도를 기록했고, XGBoost는 VirusShare 데이터셋의 양쪽 버전에서 90%의 정확도를 달성하여 향후 연구를 위한 기준 성능을 확립한다.

ABSTRACT

Nowadays, malware and malware incidents are increasing daily, even with various anti-viruses systems and malware detection or classification methodologies. Many static, dynamic, and hybrid techniques have been presented to detect malware and classify them into malware families. Dynamic and hybrid malware classification methods have advantages over static malware classification methods by being highly efficient. Since it is difficult to mask malware behavior while executing than its underlying code in static malware classification, machine learning techniques have been the main focus of the security experts to detect malware and determine their families dynamically. The rapid increase of malware also brings the necessity of recent and updated datasets of malicious software. We introduce two new, updated datasets in this work: One with 9,795 samples obtained and compiled from VirusSamples and the one with 14,616 samples from VirusShare. This paper also analyzes multi-class malware classification performance of the balanced and imbalanced version of these two datasets by using Histogram-based gradient boosting, Random Forest, Support Vector Machine, and XGBoost models with API call-based dynamic malware classification. Results show that Support Vector Machine, achieves the highest score of 94% in the imbalanced VirusSample dataset, whereas the same model has 91% accuracy in the balanced VirusSample dataset. While XGBoost, one of the most common gradient boosting-based models, achieves the highest score of 90% and 80%.in both versions of the VirusShare dataset. This paper also presents the baseline results of VirusShare and VirusSample datasets by using the four most widely known machine learning techniques in dynamic malware classification literature. We believe that these two datasets and baseline results enable researchers in this field to test and validate their methods and approaches.

연구 동기 및 목표

  • 효과적인 동적 악성코드 분류를 지원하기 위해 최신 기반의 업데이트된 악성코드 데이터셋이 점점 더 필요한 상황를 해결하기 위해.
  • 재현 가능한 연구를 위해 VirusSamples(9,795개 샘플)와 VirusShare(14,616개 샘플)라는 두 가지 새로운 데이터셋의 평형 및 비평형 버전을 제공하기 위해.
  • API 호출 기반 동적 분석을 사용하여 네 가지 널리 사용되는 기계학습 모델(SVM, XGBoost, Random Forest, Histogram-based Gradient Boosting)의 성능을 평가하기 위해.
  • 향후 새로운 동적 악성코드 탐지 방법의 비교 및 검증을 위한 기준 분류 정확도 점수를 설정하기 위해.
  • 연구 공동체가 최신 기반의 실제 세계 데이터셋을 기반으로 새로운 동적 악성코드 분류 기법의 테스트 및 벤치마킹을 가능하게 하기 위해.

제안 방법

  • VirusSamples에서 9,795개의 악성코드 샘플과 VirusShare에서 14,616개의 샘플을 수집하여 두 가지 새로운 업데이트된 데이터셋을 구성하였다.
  • 각 악성코드 샘플의 동적 분석에서 시스템 호출(API 호출) 시퀀스를 추출하여 행동 특징을 표현하였다.
  • 클래스 분포 변화에 대한 모델의 강건성 평가를 위해 각 데이터셋의 평형 및 비평형 버전을 구축하였다.
  • 다중 클래스 악성코드 패밀리 분류를 위해 지원 벡터 머신(SVM), XGBoost, Random Forest, Histogram-based Gradient Boosting의 네 가지 기계학습 모델을 적용하였다.
  • 런타임 행동을 포착하고 오브스커레이션에 저항하는 악성코드 탐지를 가능하게 하기 위해 API 호출 기반 동적 분석을 입력 표현으로 사용하였다.
  • 표준 분류 지표를 사용하여 모델 성능을 평가하였으며, 평형 및 비평형 데이터셋 구성 모두에서 정확도에 중점을 두었다.

실험 결과

연구 질문

  • RQ1최신 기반의 업데이트된 악성코드 데이터셋과 API 호출 기반 동적 분석을 사용할 때 최신 기계학습 모델의 분류 정확도는 어떠한가?
  • RQ2데이터셋의 비균형 상태가 실제 세계의 악성코드 샘플에 대한 동적 악성코드 분류 모델의 성능에 어떤 영향을 미치는가?
  • RQ3VirusSamples와 VirusShare 데이터셋의 평형 및 비평형 버전 전반에서 악성코드 패밀리를 분류하는 데 가장 높은 정확도를 달성하는 기계학습 모델은 무엇인가?
  • RQ4제안된 데이터셋과 기준 성능 결과가 향후 동적 악성코드 분류 분야의 연구를 위한 신뢰할 수 있는 벤치마크로 기능할 수 있는가?
  • RQ5SVM, XGBoost, Random Forest, Histogram-based Gradient Boosting의 성능 특성은 API 호출 시퀀스를 사용한 동적 악성코드 분류 맥락에서 어떻게 비교되는가?

주요 결과

  • 지원 벡터 머신(SVM)은 비평형 VirusSample 데이터셋에서 94%의 최고 정확도를 기록하여 이 구성에서 다른 모델보다 뛰어난 성능을 보였다.
  • 평형 VirusSample 데이터셋에서는 SVM가 91%의 정확도를 기록하여 클래스 분포 조정에도 불구하고 강력한 일반화 능력을 보였다.
  • XGBoost는 VirusShare 데이터셋의 평형 및 비평형 버전 모두에서 90%의 정확도를 기록하여 데이터 분포 변화에 관계없이 일관된 성능을 보였다.
  • Random Forest와 Histogram-based Gradient Boosting 모델은 SVM과 XGBoost에 비해 낮은 성능을 보였으며, XGBoost는 VirusShare 데이터셋의 양쪽 버전에서 80%의 정확도를 기록하였다.
  • 결과적으로 SVM과 XGBoost가 API 호출 시퀀스를 사용한 동적 악성코드 분류에서 최상의 성능을 보이며 향후 연구를 위한 신뢰할 수 있는 기준이 되었다.
  • VirusSamples(9,795개 샘플)와 VirusShare(14,616개 샘플)라는 두 가지 새로운 데이터셋은 동적 악성코드 탐지 시스템의 훈련 및 평가를 위한 최신 기반의 실제 세계 데이터를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.