[논문 리뷰] MalDetConv: Automated Behaviour-based Malware Detection Framework Based on Natural Language Processing and Deep Learning Techniques
MalDetConv는 자연어 처리 기법을 활용해 Windows API 호출 시퀀스를 분석하여 자동으로 행동 기반 악성코드 탐지가 가능한 새로운 딥러닝 프레임워크이다. CNN-BiGRU 아키텍처와 워드 임베딩, LIME를 결합함으로써, 미사용된 제로데이 악성코드에 대해 99.93%의 정확도를 달성하며, 다양한 벤치마크 데이터셋에서 최신 기술보다 뛰어난 성능을 보였다.
The popularity of Windows attracts the attention of hackers/cyber-attackers, making Windows devices the primary target of malware attacks in recent years. Several sophisticated malware variants and anti-detection methods have been significantly enhanced and as a result, traditional malware detection techniques have become less effective. This work presents MalBehavD-V1, a new behavioural dataset of Windows Application Programming Interface (API) calls extracted from benign and malware executable files using the dynamic analysis approach. In addition, we present MalDetConV, a new automated behaviour-based framework for detecting both existing and zero-day malware attacks. MalDetConv uses a text processing-based encoder to transform features of API calls into a suitable format supported by deep learning models. It then uses a hybrid of convolutional neural network (CNN) and bidirectional gated recurrent unit (CNN-BiGRU) automatic feature extractor to select high-level features of the API Calls which are then fed to a fully connected neural network module for malware classification. MalDetConv also uses an explainable component that reveals features that contributed to the final classification outcome, helping the decision-making process for security analysts. The performance of the proposed framework is evaluated using our MalBehavD-V1 dataset and other benchmark datasets. The detection results demonstrate the effectiveness of MalDetConv over the state-of-the-art techniques with detection accuracy of 96.10%, 95.73%, 98.18%, and 99.93% achieved while detecting unseen malware from MalBehavD-V1, Allan and John, Brazilian, and Ki-D datasets, respectively. The experimental results show that MalDetConv is highly accurate in detecting both known and zero-day malware attacks on Windows devices.
연구 동기 및 목표
- 진화하거나 오브스컬피케이션된 악성코드 변종을 탐지하는 데 한계가 있는 시그니처 기반 악성코드 탐지 기법의 문제점을 해결하기 위해.
- 동적 분석을 통해 API 호출 시퀀스를 분석함으로써 기존 악성코드와 제로데이 악성코드를 효과적으로 식별할 수 있는 행동 기반 악성코드 탐지 프레임워크를 개발하기 위해.
- 예측 결과에 대한 기능 수준의 설명을 제공하기 위해 LIME를 통합함으로써 딥러닝 기반 악성코드 탐지의 모델 해석 가능성 향상을 위해.
- 연구 목적을 위해 공개 가능한 새로운 데이터셋(MalBehavD-V1)을 구축하기 위해. 이 데이터셋은 정상 및 악성 실행 파일에서 추출한 Windows API 호출 시퀀스로 구성된다.
- 시스템 호출 행동을 이용한 악성코드 분류에 하이브리드 딥러닝 모델(CNN-BiGRU)과 워드 임베딩을 조합한 것이 효과적인지 입증하기 위해.
제안 방법
- 프레임워크는 Keras 토크나이저와 임베딩 레이어를 사용하여 API 호출 시퀀스를 의미 관계를 반영한 밀도 높은 벡터 표현으로 변환한다.
- 하이브리드 CNN-BiGRU 아키텍처는 임bedded된 API 호출 시퀀스에서 고차원적이고 구분력 있는 특징을 자동으로 추출한다.
- 추출된 특징은 최종 악성코드 분류를 위해 완전히 연결된 신경망을 통해 전달된다. 이는 정상 또는 악성 카테고리로의 분류를 수행한다.
- 모델은 LIME(Local Interpretable Model-agnostic Explanations) 프레임워크를 통합하여, 예측 결과에 영향을 미친 특정 API 호출을 강조함으로써 국소적이고 인스턴스 수준의 설명을 생성한다.
- 동적 분석은 Cuckoo 샌드박스를 사용하여 고립된 가상 환경에서 Windows EXE 파일의 실시간 API 호출 시퀀스를 추출함으로써 수행된다.
- 프레임워크는 API 호출 시퀀스를 자연어 텍스트로 간주함으로써 NLP 기반 처리 기법을 적용하여 악성코드 행동 모델링을 가능하게 한다.
실험 결과
연구 질문
- RQ1NLP 기반 딥러닝 모델이 시스템 API 호출 시퀀스를 분석하여 기존 악성코드와 제로데이 악성코드를 효과적으로 탐지할 수 있는가?
- RQ2제안된 CNN-BiGRU 모델의 성능은 기존 머신러닝 및 딥러닝 모델 대비 탐지 정확도와 미사용 악성코드에 대한 일반화 능력 측면에서 어떻게 비교되는가?
- RQ3LIME는 악성코드 탐지 맥락에서 모델의 분류 결정에 대한 의미 있는 인간 해석 가능한 설명을 어느 정도 제공할 수 있는가?
- RQ4MalBehavD-V1 데이터셋은 행동 기반 악성코드 탐지 시스템의 강력한 훈련 및 평가를 위해 얼마나 효과적인가?
- RQ5이 프레임워크는 다양한 악성코드 패밀리와 운영 체제 환경(최신 Windows 버전 포함) 및 PowerShell 스크립트, APK 등 다른 파일 형식으로도 일반화 가능한가?
주요 결과
- MalDetConv는 MalBehavD-V1 데이터셋의 미사용 악성코드에 대해 96.10%의 탐지 정확도를 달성하여 뛰어난 일반화 능력을 입증했다.
- Allan과 John 데이터셋에서 프레임워크는 95.73%의 탐지 정확도를 기록하여 다양한 악성코드 샘플에서 일관된 성능을 보였다.
- 브라질리언 악성코드 데이터셋에서 모델은 98.18%의 정확도를 달성하여 지역 특화 악성코드 변종에 대한 강건성을 확인했다.
- Ki-D 데이터셋에서 MalDetConv는 놀라운 99.93%의 탐지 정확도를 기록하여 제로데이 및 이전에 알려지지 않은 악성코드 탐지의 효과성을 입증했다.
- LIME 통합으로 인해 모델의 해석 가능성이 향상되어 보안 분석가들이 IsDebuggerPresent와 FindResourceW와 같은 특정 API 호출이 분류 결정에 가장 기여한 것을 식별할 수 있었다.
- 특히 미사용 및 제로데이 악성코드 샘플에서 기존 최신 기술보다 탐지 정확도와 정밀도 측면에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.