[논문 리뷰] Grouping the executables to detect malware with high accuracy
이 논문은 파일 크기를 기반으로 하는 클러스터링을 사용하여 실행 파일을 가족으로 그룹화함으로써, 알려지지 않은 또는 변형된 멀웨어 변종을 효과적으로 탐지할 수 있는 고정밀도 멀웨어 탐지 방법을 제안한다. 세 개의 변형 멀웨어 키트(G2, PS-MPC, NGVCK)에서 생성된 파일 크기에 최적의 k-평균 클러스터링을 적용함으로써 안정적인 크기 분포를 식별하고, 선택된 특징을 기반으로 분류기(Random Forest, J48, LMT, FT, NBT)를 훈련시켜 최대 99.11%의 탐지 정확도를 달성한다.
The metamorphic malware variants with the same malicious behavior (family), can obfuscate themselves to look different from each other. This variation in structure leads to a huge signature database for traditional signature matching techniques to detect them. In order to effective and efficient detection of malware in large amounts of executables, we need to partition these files into groups which can identify their respective families. In addition, the grouping criteria should be chosen such a way that, it can also be applied to unknown files encounter on computers for classification. This paper discusses the study of malware and benign executables in groups to detect unknown malware with high accuracy. We studied sizes of malware generated by three popular second generation malware (metamorphic malware) creator kits viz. G2, PS-MPC and NGVCK, and observed that the size variation in any two generated malware from same kit is not much. Hence, we grouped the executables on the basis of malware sizes by using Optimal k-Means Clustering algorithm and used these obtained groups to select promising features for training (Random forest, J48, LMT, FT and NBT) classifiers to detect variants of malware or unknown malware. We find that detection of malware on the basis of their respected file sizes gives accuracy up to 99.11% from the classifiers.
연구 동기 및 목표
- 구조적 가로막힘으로 인해 기존의 서명 기반 방법으로는 탐지되지 않는 변형 멀웨어 변종을 탐지하는 데 도전하는 것.
- 내재된 특성에 기반해 멀웨어를 가족으로 묶음으로써, 계속 커지는 대규모 서명 데이터베이스의 필요성을 줄이는 것.
- 파일 크기를 안정적인 클러스터링 기준으로 활용하여 알려지지 않은 파일에 적용 가능한 확장성 있고 효율적인 방법을 개발하는 것.
- 크기 기반 클러스터링과 선택된 특징에 기반한 지도 학습을 융합하여 알려지지 않은 멀웨어의 탐지 정확도를 향상시키는 것.
제안 방법
- 두 번째 세대 멀웨어 키트(G2, PS-MPC, NGVCK)에서 생성된 멀웨어의 파일 크기 분포 분석.
- 동일한 멀웨어 가족 내에서 크기 변동이 낮다는 관찰을 바탕으로, 파일 크기에 기반해 실행 파일을 클러스터링하기 위해 최적의 k-평균 클러스터링 알고리즘 적용.
- 클러스터링된 그룹에서 유망한 특징을 선별하여 Random Forest, J48, LMT, FT, NBT 등의 다수의 분류기 훈련.
- 각 분류기의 성능을 클러스터링 및 특징 선별된 데이터셋에서 평가하여 탐지 정확도 평가.
- 코드 구조가 변경되더라도 일관된 패턴을 식별할 수 있도록 클러스터링 결과를 기반으로 한 변형 변종 간의 일관성 있는 패턴 분석.
실험 결과
연구 질문
- RQ1코드 가로막힘이 존재하더라도 파일 크기가 변형 멀웨어를 가족으로 묶는 데 신뢰할 수 있고 안정적인 특징으로 기능할 수 있는가?
- RQ2파일 크기 기반으로 실행 파일을 클러스터링하면 알려지지 않은 멀웨어 변종의 탐지 정확도가 향상되는가?
- RQ3크기 기반 클러스터에서 선별된 특징에 기반해 훈련된 표준 기계학습 분류기의 성능는 얼마나 효과적인가?
- RQ4크기 기반 그룹화가 멀웨어 탐지에서 대규모 서명 데이터베이스의 필요성을 어느 정도 줄이는가?
주요 결과
- 동일한 키트(G2, PS-MPC, NGVCK)에서 생성된 멀웨어의 파일 크기 분포는 최소한의 변동을 보이며, 크기가 안정적인 클러스터링 특징임을 시사한다.
- 최적의 k-평균 클러스터링 알고리즘이 크기에 기반해 실행 파일을 일관된 가족으로 성공적으로 그룹화하여 일관된 특징 선별을 가능하게 하였다.
- 크기 기반 클러스터에서 유도된 특징에 기반해 훈련된 분류기는 탐지 성능을 크게 향상시켰다.
- Random Forest 분류기가 알려지지 않은 멀웨어 변종에서 최고의 탐지 정확도 99.11%를 기록하였다.
- 이 방법은 서명 데이터베이스에 의존하지 않고도 알려지지 않은 멀웨어 탐지에 대해 높은 확장성과 효과성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.