[논문 리뷰] Reliable Malware Analysis and Detection using Topology Data Analysis
이 논문은 TDA 메퍼와 지속성 호모로지 기반의 위상적 데이터 분석(TDA) 프레임워크를 제안하여 전통적인 방법들인 PCA, UMAP, t-SNE보다 악성코드 탐지 및 군집화 성능을 향상시킨다. 결과적으로 TDA 메퍼와 PCA를 조합한 방법은 숨겨진 악성코드 군집 간 관계를 효과적으로 드러내며, 지속성 다이어그램은 더 낮은 실행 시간과 더 나은 노이즈 데이터에 대한 강건성으로 겹치는 악성코드 가족을 더 빠르고 정확하게 탐지할 수 있다. 특히 랜덤 포레스트 및 결정 트리 분류기와 조합할 경우 뛰어난 성능을 발휘한다.
Increasingly, malwares are becoming complex and they are spreading on networks targeting different infrastructures and personal-end devices to collect, modify, and destroy victim information. Malware behaviors are polymorphic, metamorphic, persistent, able to hide to bypass detectors and adapt to new environments, and even leverage machine learning techniques to better damage targets. Thus, it makes them difficult to analyze and detect with traditional endpoint detection and response, intrusion detection and prevention systems. To defend against malwares, recent work has proposed different techniques based on signatures and machine learning. In this paper, we propose to use an algebraic topological approach called topological-based data analysis (TDA) to efficiently analyze and detect complex malware patterns. Next, we compare the different TDA techniques (i.e., persistence homology, tomato, TDA Mapper) and existing techniques (i.e., PCA, UMAP, t-SNE) using different classifiers including random forest, decision tree, xgboost, and lightgbm. We also propose some recommendations to deploy the best-identified models for malware detection at scale. Results show that TDA Mapper (combined with PCA) is better for clustering and for identifying hidden relationships between malware clusters compared to PCA. Persistent diagrams are better to identify overlapping malware clusters with low execution time compared to UMAP and t-SNE. For malware detection, malware analysts can use Random Forest and Decision Tree with t-SNE and Persistent Diagram to achieve better performance and robustness on noised data.
연구 동기 및 목표
- 기존의 악성코드 탐지 방법의 한계, 즉 높은 거짓 양성률과 다형성 및 메타모픽 악성코드에 대한 낮은 강건성을 해결하기 위해.
- 위상적 데이터 분석(TDA) 기법—특히 TDA 메퍼, 지속성 호모로지, 토마토—이 악성코드 군집화 및 탐지에 얼마나 효과적인지 평가하기 위해.
- 다양한 기계학습 분류기와 함께 TDA 기법을 전통적인 차원 축소 기법(PCA, UMAP, t-SNE)과 비교하기 위해.
- 기업 및 다중 지역 환경에서 TDA 기반 악성코드 탐지의 확장 가능한 구현 방안을 제안하기 위해.
제안 방법
- 연구는 지속성 호모로지, TDA 메퍼, 토마토를 활용한 위상적 데이터 분석(TDA) 기법을 사용하여 악성코드 데이터의 특징 추출 및 패턴 탐색을 수행한다.
- TDA 메퍼는 차원 축소된 데이터로부터 위상적 그래프를 구성함으로써 악성코드 군집 간의 숨겨진 관계를 시각화하고 식별하는 데 사용된다.
- 필터링된 데이터로부터 지속성 다이어그램을 생성하여 지속적인 위상적 특징을 탐지함으로써 겹치는 악성코드 가족의 강건한 식별을 가능하게 한다.
- 프레임워크는 랜덤 포레스트, 결정 트리, XGBoost, LightGBM와 같은 기계학습 분류기와 함께 TDA를 통합하여 악성코드 탐지에 활용한다.
- 실험은 두 가지 실세계 데이터셋(CIC-MalMem-2022(PC 악성코드) 및 CCCS-CIC-AndMal-2020(모바일 악성코드))을 대상으로 수행되었으며, 균형 및 비균형 데이터 분포 모두를 고려하였다.
- 시스템 수준의 배포 패tern 분석을 통해 확장성 있는 배포 권고 사항을 도출하였으며, 이는 TDAMapper-PCA 서비스의 자동 스케일링과 CDN 및 로드 밸런서를 활용한 분산 경고 처리를 포함한다.
실험 결과
연구 질문
- RQ1TDA 기반 특징 공학 기법은 기존 방법(PCA, UMAP, t-SNE)에 비해 악성코드 샘플 군집화 및 악성코드 가족 간 숨겨진 관계 탐지에서 어떻게 성능을 발휘하는가?
- RQ2지속성 호모로지, TDA 메퍼, 토마토 중 어느 TDA 기법이 낮은 실행 시간으로 겹치는 악성코드 군집을 가장 잘 식별하는가?
- RQ3랜덤 포레스트, 결정 트리, XGBoost, LightGBM 중 어떤 기계학습 분류기가 TDA 특징과 조합했을 때 가장 높은 탐지 정확도와 강건성을 달성하는가? 특히 노이즈가 많은 데이터 조건에서.
- RQ4TDA 기반 악성코드 탐지는 어떻게 대규모 분산 다중 지역 기업 환경에서 효과적으로 확장할 수 있는가?
주요 결과
- TDA 메퍼와 PCA를 조합한 방법은 PCA 단독 사용보다 악성코드 군집 간 숨겨진 관계를 더 잘 식별하여 악성코드 가족 간 상호관계를 더 잘 이해할 수 있도록 한다.
- 지속성 다이어그램은 UMAP 및 t-SNE보다 더 빠른 실행 시간과 겹치는 악성코드 군집 탐지에서 더 뛰어난 성능을 보이며, 특히 데이터 왜곡 상황에서도 유리하다.
- 랜덤 포레스트 및 결정 트리 분류기는 t-SNE 및 지속성 다이어그램과 조합했을 때 노이즈가 많은 실세계 데이터에서 뛰어난 탐지 성능과 강건성을 달성한다.
- XGBoost 및 LightGBM 분류기는 t-SNE와 함께 사용했을 때에만 최적의 성능과 강건성을 발휘하며, 다른 차원 축소 기법과 조합할 경우 그렇지 않다.
- 연구는 확장 가능한 배포 권고 사항을 제시하였으며, 이는 TDAMapper-PCA 서비스의 자동 스케일링과 CDN 및 로드 밸런서의 활용을 포함한다. 이를 통해 다중 지역 환경에서 대규모 악성코드 탐지에 대응할 수 있다.
- 모든 실험 결과는 재현 가능하며, 전체 코드와 데이터는 공개된 복제 팩키지에서 제공된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.