Skip to main content
QUICK REVIEW

[논문 리뷰] Task-Aware Meta Learning-based Siamese Neural Network for Classifying Obfuscated Malware

Jinting Zhu, Julian Jang‐Jaccard|arXiv (Cornell University)|2021. 10. 26.
Advanced Malware Detection Techniques참고 문헌 42인용 수 6
한 줄 요약

이 논문은 제어 흐름 가로막힘을 겪은 악성코드의 분류를 향상시키기 위해 엔트로피 특징과 VGG-16 기반 이미지 특징을 동적 가중치 생성기로 융합하는 작업 인식 메타학습 기반의 시아모이 신경망을 제안한다. 이 모델은 소수의 샘플 학습 설정에서 >91%의 정확도를 달성하며, 하이브리드 손실 함수를 통해 특징 클러스터링을 향상시키고 거짓 양성률을 감소시켜 기준 SNN보다 뛰어난 성능을 보인다.

ABSTRACT

Malware authors apply different techniques of control flow obfuscation, in order to create new malware variants to avoid detection. Existing Siamese neural network (SNN)-based malware detection methods fail to correctly classify different malware families when such obfuscated malware samples are present in the training dataset, resulting in high false-positive rates. To address this issue, we propose a novel task-aware few-shot-learning-based Siamese Neural Network that is resilient against the presence of malware variants affected by such control flow obfuscation techniques. Using the average entropy features of each malware family as inputs, in addition to the image features, our model generates the parameters for the feature layers, to more accurately adjust the feature embedding for different malware families, each of which has obfuscated malware variants. In addition, our proposed method can classify malware classes, even if there are only one or a few training samples available. Our model utilizes few-shot learning with the extracted features of a pre-trained network (e.g., VGG-16), to avoid the bias typically associated with a model trained with a limited number of training samples. Our proposed approach is highly effective in recognizing unique malware signatures, thus correctly classifying malware samples that belong to the same malware family, even in the presence of obfuscated malware variants. Our experimental results, validated by N-way on N-shot learning, show that our model is highly effective in classification accuracy, exceeding a rate extgreater 91\%, compared to other similar methods.

연구 동기 및 목표

  • 학습 데이터에 제어 흐름 가로막힘을 겪은 변종이 포함될 경우 기존의 시아모이 신경망(SNN) 기반 악성코드 탐지에서 높은 거짓 양성률을 해결하기 위해.
  • 가족당 하나 또는 몇 개의 학습 샘플만 존재하는 소수의 샘플 학습 조건 하에서 악성코드 가족 분류를 향상시키기 위해.
  • VGG-16에서 사전 학습된 특징을 활용한 메타학습을 통해 제한된 학습 데이터로 인한 모델 편향을 줄이기 위해.
  • 엔트로피 기반 특징과 딥 이미지 특징을 융합하여 특징 임bedding의 구분 능력을 향상시켜 가로막힘을 겪은 변종의 클러스터링을 향상시키기 위해.
  • 코드 가로막힘 기법에도 불구하고 고유한 악성코드 서명을 탐지할 수 있는 강력하고 일반화 능력이 뛰어난 모델을 개발하기 위해.

제안 방법

  • 악성코드 바이너리 코드에서 유도된 엔트로피 특징을 사용해 작업별로 특화된 가중치를 생성하는 작업 인식 메타러닝 네트워크를 도입한다.
  • 사전 학습된 VGG-16 네트워크에서 유도된 이미지 특징과 엔트로피 특징을 융합하여 시아모이 네트워크의 하이브리드 입력을 구성한다.
  • 특징 공간 내에서 동일 클래스 간 변동성을 최소화하고 이질 클래스 간 간격을 최대화하기 위해 대비 손실과 중심 손실을 조합한 하이브리드 손실 함수를 적용한다.
  • 소수의 샘플 학습을 위해 N-웨이, N-샷 평가 프로토콜을 사용하여 제한된 데이터로 모델을 훈련하고 검증하며, 실제 악성코드 탐지 시나리오를 시뮬레이션한다.
  • 메트릭 공간에서 학습된 거리 임계값을 사용해 악성코드 샘플 간의 유사도 점수를 계산하여 분류의 강건성을 향상시킨다.
  • 모델 성능을 평가하기 위해 AUC-ROC 곡선과 TPR/FPR 분석을 사용하여 5-way, 10-way, 15-way 분류 작업에서 일샷 및 오십샷 학습 설정에서의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1학습 데이터에 제어 흐름 가로막힘을 겪은 변종이 포함된 경우, 메타학습 기반의 시아모이 네트워크가 악성코드 가족을 효과적으로 분류할 수 있는가?
  • RQ2엔트로피 특징과 딥 이미지 특징을 융합할 경우, 소수의 샘플 학습 기반의 악성코드 탐지에서 분류 정확도는 어떻게 향상되는가?
  • RQ3하이브리드 손실 함수(대비 손실 + 중심 손실)는 특징 공간 내에서 양성 및 음성 쌍의 클러스터링을 얼마나 향상시키는가?
  • RQ4일샷 및 오십샷 학습 조건 하에서 N-웨이 분류가 증가함에 따라 모델의 성능는 어떻게 변화하는가?
  • RQ5학습 데이터가 심각하게 제한된 조건에서 작업 인식 메타러너는 편향을 줄이고 일반화 능력을 향상시키는가?

주요 결과

  • 제안된 모델은 5-way, 10-way, 15-way 일샷 학습 작업에서 각각 AUC-ROC 0.92, 0.91, 0.80를 달성하여 일반적인 SNN 기준 모델보다 뛰어난 성능을 보였다.
  • 오십샷 학습 조건에서 모델은 5-way, 10-way, 15-way 분류 작업에서 각각 95.6%, 90.7%, 86.8%의 정확도를 기록하여 제한된 데이터 하에서도 강력한 일반화 능력을 입증했다.
  • 하이브리드 손실 함수는 동일 클래스 간 거리를 크게 감소시키고 이질 클래스 간 간격을 증가시켜 더 잘 분리된 특징 클러스터를 만들어 냈다.
  • 작업 인식 메타러너는 엔트로피 특징을 효과적으로 활용해 특징 임베딩을 조정하여 가로막힘에 대한 분류 강건성을 향상시켰다.
  • N-웨이가 증가함에 따라 모델의 성능가 유지되었으며, 이는 확장성과 더 높은 내부 클래스 분산에 대한 저항성을 시사했다.
  • AUC-ROC 곡선은 모든 설정에서 기준 SNN보다 예측의 정확도가 높고, 곡선 아래 면적이 더 큰 것으로 확인되어 모델의 일관된 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.