Skip to main content
QUICK REVIEW

[논문 리뷰] Emulating malware authors for proactive protection using GANs over a distributed image visualization of dynamic file behavior

Vineeth S. Bhaskara, Debanjan Bhattacharyya|arXiv (Cornell University)|2018. 07. 19.
Advanced Malware Detection Techniques인용 수 8
한 줄 요약

이 논문은 동적 파일 행동의 분산 RGB 이미지 표현을 기반으로 훈련하여 합성 악성 소프트웨어를 생성하는 GAN 기반 프레임워크를 제안한다. 이는 사전적 위협 탐지에 기여한다. API 호출 n-그램을 이미지로 인코딩함으로써, 노이즈 벡터 산술을 통해 새로운 의미적으로 일관된 악성 소프트웨어 변종을 생성함으로써 알려지지 않은 위협의 탐지 능력을 향상시킨다.

ABSTRACT

Malware authors have always been at an advantage of being able to adversarially test and augment their malicious code, before deploying the payload, using anti-malware products at their disposal. The anti-malware developers and threat experts, on the other hand, do not have such a privilege of tuning anti-malware products against zero-day attacks pro-actively. This allows the malware authors to being a step ahead of the anti-malware products, fundamentally biasing the cat and mouse game played by the two parties. In this paper, we propose a way that would enable machine learning based threat prevention models to bridge that gap by being able to tune against a deep generative adversarial network (GAN), which takes up the role of a malware author and generates new types of malware. The GAN is trained over a reversible distributed RGB image representation of known malware behaviors, encoding the sequence of API call ngrams and the corresponding term frequencies. The generated images represent synthetic malware that can be decoded back to the underlying API call sequence information. The image representation is not only demonstrated as a general technique of incorporating necessary priors for exploiting convolutional neural network architectures for generative or discriminative modeling, but also as a visualization method for easy manual software or malware categorization, by having individual API ngram information distributed across the image space. In addition, we also propose using smart-definitions for detecting malwares based on perceptual hashing of these images. Such hashes are potentially more effective than cryptographic hashes that do not carry any meaningful similarity metric, and hence, do not generalize well.

연구 동기 및 목표

  • 악성 소프트웨어 시스템의 적대적 테스트에서의 불균형을 해결하기 위해, 악성 소프트웨어 작성자를 사전에 모방할 수 있도록 하는 것.
  • 암호 해시의 한계를 극복하기 위해 파일 서명이 아닌 행동 패턴을 모델링함으로써 제로데이 악성 소프트웨어를 탐지하는 것.
  • 딥 러닝 모델이 실제 행동 의미를 갖는 합성 악성 소프트웨어를 생성함으로써 알려지지 않은 취약점을 사전에 탐색할 수 있도록 하는 것.
  • 기계 학습과 시각화를 위한 의미적 구조를 유지하는 가역적 이미지 표현을 악성 소프트웨어 행동에 적용하는 것.
  • 잠재 공간 내의 벡터 산술을 통해 알려진 악성 소프트웨어의 행동 특성을 조합하여 새로운 하이브리드 악성 소프트웨어 패턴을 생성하는 것

제안 방법

  • API 호출 n-그램과 단어 빈도 인코딩을 사용하여 동적 파일 행동을 가역적인 분산 RGB 이미지 표현으로 변환하는 것.
  • 이미지 표현을 기반으로 딥 컨volution 신경망 GAN을 훈련하여 악성 행동 분포를 학습하고 새로운 합성 악성 소프트웨어 이미지를 생성하는 것.
  • 생성망 네트워크를 사용하여 잠재 노이즈 벡터에서 새로운 악성 소프트웨어 표현을 샘플링함으로써 새로운 악성 행동의 제어된 생성을 가능하게 하는 것.
  • 잠재 공간 내에서 노이즈 벡터 산술(예: $ \vec{z}_{\text{A}} - \vec{z}_{\text{B}} + \vec{z}_{\text{C}} $)을 적용하여 다양한 악성 소프트웨어 행동의 의미적 특징을 하이브리드 변종으로 조합하는 것.
  • 생성된 이미지를 다시 API 호출 시퀀스로 디코딩하여 의미적 일관성과 행동의 타당성을 검증하는 것.
  • 이미지 표현에 대한 인지 해싱을 구현하여 시각적 유사성 기반으로 악성 소프트웨어 패밀리 감지를 가능하게 하여 기존 암호 해시보다 더 나은 일반화 성능을 확보하는 것.

실험 결과

연구 질문

  • RQ1이미지로 시각화된 동적 악성 소프트웨어 행동에 대해 딥 생성 모델인 GAN을 효과적으로 훈련시켜 현실적인 합성 악성 소프트웨어를 생성할 수 있는가?
  • RQ2이미지 표현이 충분한 의미 정보를 유지하여 API 호출 시퀀스와 행동 패턴을 정확히 복원할 수 있는가?
  • RQ3GAN의 잠재 공간 내에서의 벡터 산술이 여러 악성 소프트웨어 샘플의 기능을 조합하여 의미적으로 일관된 하이브리드 악성 소프트웨어 행동을 생성할 수 있는가?
  • RQ4이미지 표현의 인지 해싱이 기존 암호 해시보다 악성 소프트웨어 패밀리 감지에 더 나은 성능을 보일 수 있는가?
  • RQ5이 프레임워크는 실제 배포 이전에 적대적 테스트를 시뮬레이션함으로써 얼마나 사전적 위협 탐지 능력을 향상시킬 수 있는가?

주요 결과

  • 이미지 표현은 API 호출 n-그램과 단어 빈도를 컨volution 신경망과 호환되는 형식으로 성공적으로 인코딩하여 효과적인 생성 및 구분 모델링을 가능하게 했다.
  • GAN 생성망은 의미 있는 API 호출 시퀀스로 복원 가능한 합성 악성 소프트웨어 이미지를 생성하여 생성된 행동의 의미적 정확성을 입증했다.
  • 잠재 공간 내의 노이즈 벡터 산술은 레지스트리 수정 및 원격 명령 실행과 같은 일관된 악성 의미를 유지하는 하이브리드 악성 소프트웨어 표현을 생성했다.
  • 이미지 표현의 인지 해싱은 시각적 유사성 기반으로 악성 소프트웨어 패밀리 감지를 가능하게 하여 기존 암호 해시보다 더 나은 일반화 성능을 제공했다.
  • 합성 악성 소프트웨어 생성을 통한 적대적 테스트 시뮬레이션을 통해 모델은 제로데이 위협에 대한 노출 기간을 줄이며 사전적 위협 탐지 능력을 향상시켰다.
  • 이 접근법은 소스 코드에 직접 접근하지 않더라도 딥 러닝의 아키텍처 엔지니어링을 실행 가능한 행동 모델링에 적용할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.