Skip to main content
QUICK REVIEW

[논문 리뷰] CNN vs ELM for Image-Based Malware Classification

Mugdha Jain, William Andreopoulos|arXiv (Cornell University)|2021. 03. 24.
Advanced Malware Detection Techniques참고 문헌 22인용 수 5
한 줄 요약

이 논문은 Malimg 데이터셋을 사용하여 악성코드 바이너리를 Grayscale 이미지로 시각화한 이미지 기반 악성코드 분류에서, 컨볼루션 신경망(CNNs)과 극단적 학습 기계(ELMs)를 비교한다. 이미지 분류 분야에서 표준으로 여겨지는 CNNs에 비해 ELMs는 97.7%의 정확도를 기록하며 최고의 CNN(96.3%)를 略로 뛰어넘고, 학습 속도는 최대 67배 빠르며, 이는 대규모 악성코드 탐지에 매우 효율적임을 시사한다.

ABSTRACT

Research in the field of malware classification often relies on machine learning models that are trained on high-level features, such as opcodes, function calls, and control flow graphs. Extracting such features is costly, since disassembly or code execution is generally required. In this paper, we conduct experiments to train and evaluate machine learning models for malware classification, based on features that can be obtained without disassembly or execution of code. Specifically, we visualize malware samples as images and employ image analysis techniques. In this context, we focus on two machine learning models, namely, Convolutional Neural Networks (CNN) and Extreme Learning Machines (ELM). Surprisingly, we find that ELMs can achieve accuracies on par with CNNs, yet ELM training requires less than~2\%\ of the time needed to train a comparable CNN.

연구 동기 및 목표

  • 실행 파일의 이미지 기반 표현을 사용하여 ELMs와 CNNs의 악성코드 분류 성능을 평가하는 것.
  • ELMs가 학습 시간을 극적으로 단축하면서도 CNN의 성능을 따라하거나 능가할 수 있는지 확인하는 것.
  • 디어셈블링이나 실행 없이도 원시 바이트에서 이미지로의 매핑을 통해 특징 추출이 가능한지 탐색하는 것.
  • 앙상블 방법과 하이퍼파라미터 튜닝이 악성코드 탐지에서 ELM의 안정성과 정확도에 미치는 영향을 조사하는 것.
  • ELMs가 빠르게 진화하는 악성코드 패밀리에 대한 실시간 탐지에 스케일러블한지 평가하는 것.

제안 방법

  • Malimg 데이터셋의 악성코드 샘플은 원시 바이트를 픽셀 값으로 직접 매핑하여 회색조 이미지로 변환된다.
  • 두 가지 입력 표현 방식을 사용한다: 2차원 이미지(예: 128×128)와 이미지에서 유도된 1차원 편평화된 벡터(예: 1024×1).
  • 성능 최적화를 위해 깊이, 필터 수, 입력 크기가 다양한 다양한 CNN 아키텍처를 학습시킨다.
  • 표준 및 앙상블 설정을 사용하여 ELM 모델을 학습시키며, 드롭아웃과 클래스 가중치를 적용한 50개의 ELM을 조합한다.
  • ELM의 활성화 함수는 ReLU이며, 히든 레이어는 1024개의 뉴런을 사용하고, 최적의 성능을 위해 MLP 커널(α=1)을 적용한다.
  • 정확도와 F1 스코어를 극대화하기 위해 학습률, 배치 크기, 정규화 등의 하이퍼파라미터 튜닝을 두 모델에 모두 수행한다.

실험 결과

연구 질문

  • RQ1이미지 기반 바이너리 표현을 사용할 때 ELMs가 CNNs와 비슷하거나 더 높은 정확도를 달성할 수 있는가?
  • RQ2동일한 악성코드 분류 작업에 적용했을 때 ELM의 학습 시간은 CNN에 비해 얼마나 다른가?
  • RQ3앙상블 ELMs를 사용할 경우 단일 ELM보다 Malimg 데이터셋에서 분류 성능과 안정성이 향상되는가?
  • RQ4악성코드 이미지에서 유도된 1차원 특징 벡터는 ELMs와 함께 효과적으로 사용되어 높은 정확도를 유지하면서 계산 비용을 줄일 수 있는가?
  • RQ5특히 CNNs가 전체 패밀리의 샘플을 탐지하지 못하는 경우에도 ELM의 성능은 모든 25개의 악성코드 패밀리에 대해 안정적인가?

주요 결과

  • 최고의 ELM 기반 모델은 전체 정확도 97.7%를 기록하며, Malimg 데이터셋에서 최고의 CNN 모델(96.3%)을 능가했다.
  • ELMs는 25개 악성코드 패밀리 중 18개에서 F1 스코어가 동일하거나 더 높았으며, CNN 모델은 완전히 Autorun.K 패밀리의 샘플을 탐지하지 못했다.
  • ELM 모델은 이전에 놓친 Autorun.K 패밀리의 모든 인스턴스를 정확히 분류하여 희귀하거나 도전적인 클래스에 대해 뛰어난 강건성을 보였다.
  • ELM 학습에 소요된 시간은 동일한 단일 컨볼루션 레이어 CNN에 비해 2% 미만이었으며, 더 깊은 CNN에 대해서는 1.5% 미만이었다.
  • 더 계산 비용이 높은 RBF 커널을 사용한 경우에도 ELM 학습 시간은 가장 빠른 CNN 아키텍처에 비해 30% 미만이었다.
  • 드롭아웃과 클래스 가중치(α=1)를 적용한 앙상블 ELM 접근 방식은 내재된 ELM의 변동성을 극복하며 안정성과 성능을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.