Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning for Robust Android Malware Familial Classification

Yueming Wu, Shihan Dou|arXiv (Cornell University)|2021. 07. 08.
Advanced Malware Detection Techniques참고 문헌 47인용 수 7
한 줄 요약

이 논문은 오염된 안드로이드 악성코드의 강건하고 해석 가능한 가족 분류를 위한 대trastive 학습 기반 시스템인 IFDroid를 제안한다. 중심성 분석을 통해 기능 호출 그래프를 이미지로 변환하고, 지도 기반 대비 학습을 적용함으로써 IFDroid는 69,421개의 오염된 샘플에서 98.4%의 F1을 달성하며 최신 기술을 뛰어넘는 성능을 보이며, 학습된 표현에 대한 Grad-CAM++ 시각화를 통해 히트맵 기반의 설명 가능성을 제공한다.

ABSTRACT

Due to its open-source nature, Android operating system has been the main target of attackers to exploit. Malware creators always perform different code obfuscations on their apps to hide malicious activities. Features extracted from these obfuscated samples through program analysis contain many useless and disguised features, which leads to many false negatives. To address the issue, in this paper, we demonstrate that obfuscation-resilient malware family analysis can be achieved through contrastive learning. The key insight behind our analysis is that contrastive learning can be used to reduce the difference introduced by obfuscation while amplifying the difference between malware and other types of malware. Based on the proposed analysis, we design a system that can achieve robust and interpretable classification of Android malware. To achieve robust classification, we perform contrastive learning on malware samples to learn an encoder that can automatically extract robust features from malware samples. To achieve interpretable classification, we transform the function call graph of a sample into an image by centrality analysis. Then the corresponding heatmaps can be obtained by visualization techniques. These heatmaps can help users understand why the malware is classified as this family. We implement \emph{IFDroid} and perform extensive evaluations on two datasets. Experimental results show that \emph{IFDroid} is superior to state-of-the-art Android malware familial classification systems. Moreover, \emph{IFDroid} is capable of maintaining a 98.4\% F1 on classifying 69,421 obfuscated malware samples.

연구 동기 및 목표

  • 안드로이드 앱에서 코드 오염으로 인한 악성코드 가족 분류의 부정확성 문제를 해결하기 위해.
  • 구조적 코드 변형에도 불구하고 높은 정확도를 유지할 수 있는 오염에 강건한 악성코드 분류 시스템을 개발하기 위해.
  • 학습된 표현에 대한 Grad-CAM++ 시각화를 통해 핵심 특징을 시각화하여 해석 가능한 분류를 가능하게 하기 위해.
  • 대비 학습이 오염으로 인한 노이즈를 줄이고 악성코드 가족 간의 의미적 차이를 증폭시킬 수 있음을 보여주기 위해.

제안 방법

  • 도시, 밀도, 중심성, 고유벡터 중심성의 네 가지 중심성 지표를 사용하여 각 안드로이드 앱의 기능 호출 그래프를 2차원 이미지로 변환하기.
  • 양성 쌍(원본 및 오염된 버전) 간 유사도를 최대화하고, 음성 쌍(다른 악성코드 가족) 간 유사도를 최소화하기 위해 인코더를 훈련하기 위해 지도 기반 대비 학습을 적용하기.
  • 중심성 기반 이미지에서 강력한 특징을 추출하기 위해 CNN 기반 인코더를 사용하고, 훈련 중에 대비 손실을 최적화하기.
  • 분류 결정에 가장 기여한 영역(즉, 그래프의 부분 구조)을 시각화하기 위해 Grad-CAM++를 사용하여 클래스 구분 히트맵을 생성하기.
  • 지속적 학습을 활용하여 사전 훈련된 인코더를 사용해 새로운 악성코드 가족의 제로샷 또는 피처샷 분류를 수행하기.
  • 69,421개의 오염된 샘플을 포함한 두 개의 데이터셋에서 시스템을 평가하여 F1 점수와 강건성을 측정하기.
Figure 1: Motivation scenario of IFDroid
Figure 1: Motivation scenario of IFDroid

실험 결과

연구 질문

  • RQ1대비 학습이 악성코드 가족 분류에 대한 코드 오염의 영향을 효과적으로 줄일 수 있는가?
  • RQ2중심성 기반 그래프-이미지 변환과 대비 학습의 조합이 악성코드 분류를 위한 강건하고 일반화 가능한 특징을 생성할 수 있는가?
  • RQ3제안된 방법은 최신 기술의 안드로이드 악성코드 가족 분류 시스템에 비해 정확도와 강건성 면에서 어떻게 비교되는가?
  • RQ4Grad-CAM++와 같은 시각화 기법이 모델의 분류 결정에 대한 의미 있는 해석 가능성을 제공할 수 있는가?

주요 결과

  • IFDroid는 69,421개의 오염된 안드로이드 악성코드 샘플에서 98.4%의 F1 점수를 달성하여 코드 오염에 대한 강건성을 입증한다.
  • Dendroid, Apposcopy, FalDroid, DroidSIFT를 포함한 10개의 최신 기술적 악성코드 분류 시스템을 뛰어넘는 성능을 보인다.
  • Grad-CAM++를 통한 히트맵 시각화가 분류에 기여한 핵심 서브그래프 영역을 성공적으로 강조하여 모델의 해석 가능성을 향상시켰다.
  • 다양한 중심성 측정법의 사용은 효과적인 변형을 만드는 데 복잡성을 증가시켜 악성 공격에 대한 저항력을 높였다.
  • 사전 훈련된 인코더를 활용해 전체 재훈련 없이도 지속적 학습을 통해 새로운 악성코드 가족의 효과적인 피처샷 분류가 가능했다.
Figure 2: System overview of IFDroid
Figure 2: System overview of IFDroid

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.