Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Neural Malware Detection Models for Emulation Sequence Learning

Rakshit Agrawal, Jack W. Stokes|arXiv (Cornell University)|2018. 06. 28.
Advanced Malware Detection Techniques참고 문헌 29인용 수 5
한 줄 요약

이 논문은 Long Short-Term Memory(LSTM)와 컨volutional Neural Networks(CNNs)를 활용하여 API 호출의 전체 길이의 에뮬레이션 시퀀스를 분석함으로써, 긴 시퀀스 내부에 깊이 숨겨진 경우에도 다형성 악성 소프트웨어를 탐지할 수 있는 강건한 신경망 악성 소프트웨어 탐지 모델을 제안한다. 주요 기여는 매우 긴 시퀀스(최대 수십만 건의 이벤트)에 대해 높은 정확도로 끝에서 끝까지 학습이 가능한 Convoluted Partitioning of Long Sequences(CPoLS) 방법론으로, 634,249개의 시퀀스로 구성된 데이터셋에서의 성능을 입증한다.

ABSTRACT

Malicious software, or malware, presents a continuously evolving challenge in computer security. These embedded snippets of code in the form of malicious files or hidden within legitimate files cause a major risk to systems with their ability to run malicious command sequences. Malware authors even use polymorphism to reorder these commands and create several malicious variations. However, if executed in a secure environment, one can perform early malware detection on emulated command sequences. The models presented in this paper leverage this sequential data derived via emulation in order to perform Neural Malware Detection. These models target the core of the malicious operation by learning the presence and pattern of co-occurrence of malicious event actions from within these sequences. Our models can capture entire event sequences and be trained directly using the known target labels. These end-to-end learning models are powered by two commonly used structures - Long Short-Term Memory (LSTM) Networks and Convolutional Neural Networks (CNNs). Previously proposed sequential malware classification models process no more than 200 events. Attackers can evade detection by delaying any malicious activity beyond the beginning of the file. We present specialized models that can handle extremely long sequences while successfully performing malware detection in an efficient way. We present an implementation of the Convoluted Partitioning of Long Sequences approach in order to tackle this vulnerability and operate on long sequences. We present our results on a large dataset consisting of 634,249 file sequences, with extremely long file sequences.

연구 동기 및 목표

  • 기존 서명 기반 방법으로는 탐지되지 않는 다형성 악성 소프트웨어를 탐지하기 위해 에뮬레이션에서 유도된 행동 시퀀스를 분석함으로써 다형성 악성 소프트웨어 탐지의 과제를 해결한다.
  • 기존 모델들이 짧은 시퀀스(예: ≤200개 이벤트)만 처리할 수 있는 한계를 극복하여, 공격자가 긴 시퀀스 내부에 악성 행동을 깊이 숨길 수 있는 상황을 대비한다.
  • 시퀀스를 잘라내거나 맥락을 손상시키지 않고도 전체 길이의 가변 길이 이벤트 시퀀스에서 학습할 수 있는 끝에서 끝까지의 신경망 모델을 개발한다.
  • 악성 행동을 숨기기 위해 명령어 재정렬, 루프, 또는 가짜 명령어 삽입 등의 기법을 사용하는 악성 소프트웨어에 대한 탐지 강건성을 향상시킨다.
  • 긴 시퀀스에서 순차적 의존성 모델링을 위한 LSTM과 국소적 이벤트 패턴 탐지에 적합한 CNN의 조합이 악성 소프트웨어 탐지에 어떻게 기여하는지 입증한다.

제안 방법

  • 이벤트 시퀀스의 장거리 의존성을 모델링하기 위해 LSTM 네트워크를 사용하고, 악성 이벤트의 국소적 패턴을 탐지하기 위해 CNN을 활용하는 하이브리드 아키텍처를 도입한다.
  • 긴 시퀀스를 겹치는, 다루기 쉬운 조각들로 나누면서도 순서적 맥락을 유지할 수 있도록 Convoluted Partitioning of Long Sequences(CPoLS) 기법을 제안한다.
  • 각 세그먼트에서 국소적 특징을 추출하기 위해 세그먼트 기반의 컨volutional 처리 파이프라인을 사용한 후, 이들 세그먼트 간의 순서적 모델링을 LSTM 기반으로 수행한다.
  • 멀티플 목적 최적화를 통해 공동 최적화를 수행하는 끝에서 끝까지의 학습 전략을 구현하며, 악성 소프트웨어 분류를 위한 주요 손실 외에 기울기 흐름을 향상시키기 위한 보조 손실을 포함한다.
  • 이벤트 임베딩 레이어를 적용하여 시스템 호출의 조밀한 표현을 학습함으로써 API 이벤트 간의 의미적 관계를 포착할 수 있도록 한다.
  • 변동 길이의 긴 시퀀스를 고정 크기의 겹치는 세그먼트로 동적으로 분할할 수 있는 새로운 'Chunkify' 기법을 도입하여, 시퀀스 무결성을 훼손하지 않으면서도 효율적인 처리를 가능하게 한다.

실험 결과

연구 질문

  • RQ1표준 RNN의 처리 능력을 초월하는 매우 긴 API 호출 시퀀스에서 신경망 모델이 효과적으로 악성 소프트웨어를 탐지할 수 있는가?
  • RQ2CPoLS 기법은 긴 시퀀스의 효율적 처리를 가능하게 하면서도 순서적 맥락을 어떻게 유지하는가?
  • RQ3짧은 시퀀스에 국한된 모델 대비 하이브리드 LSTM-CNN 모델이 탐지 정확도를 얼마나 향상시키는가?
  • RQ4끝에서 끝까지의 학습 프레임워크에서 보조 손실을 사용할 경우 모델의 강건성과 일반화 능력이 향상되는가?
  • RQ5완전한 길이의 시퀀스 학습 방식은 도식화된 시퀀스나 샘플링 기반 방법에 비해, 지연된 악성 행동을 보이는 도전적인 악성 소프트웨어 탐지에 어떻게 비교되는가?

주요 결과

  • 제안된 모델은 634,249개의 파일 시퀀스로 구성된 대규모 데이터셋에서 높은 탐지 정확도를 달성하여 전체 길이의 시퀀스에 대한 끝에서 끝까지의 학습 가능성을 입증한다.
  • CPoLS 기법은 악성 이벤트가 시퀀스의 깊은 곳에 위치해 있을지라도 악성 소프트웨어 탐지를 성공적으로 수행하여, 짧은 입력 길이에 제한된 모델의 한계를 극복한다.
  • 하이브리드 LSTM-CNN 아키텍처는 악성 소프트웨어 탐지에 필수적인 국소적 이벤트 패턴과 장거리 의존성을 동시에 잘 포착하여 베이스라인 모델보다 뛰어난 성능을 보인다.
  • AoLL 모델에서 다중 목적과 보조 손실을 활용함으로써 기울기 흐름이 향상되고 모델 수렴성 및 강건성이 향상된다.
  • Chunkify 기법은 다양한 길이와 극단적인 길이의 시퀀스를 효율적으로 처리할 수 있게 하여, 시퀀스 잘라내기 없이도 높은 성능을 유지한다.
  • 모델들은 전체 시퀀스에 걸친 동시 발생 패턴을 학습할 수 있기 때문에, 명령어 재정렬이나 양성 명령어 삽입 등의 다형성 변형에 대해 강건하게 대응할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.