[논문 리뷰] Maat: Automatically Analyzing VirusTotal for Accurate Labeling and Effective Malware Detection
Maat는 VirusTotal 스캔 보고서를 사용하여 안정적이고 정확한 레이블링 전략을 자동으로 생성하는 기계학습 기반 방법을 제안한다. 이는 수동 임계값 기반 접근 방식의 한계를 극복하며, 레이블링 정확도와 후속 악성코드 탐지 모델의 효과성에서 모두 임계값 기반 레이블링을 뛰어넘는다.
The malware analysis and detection research community relies on the online platform VirusTotal to label Android apps based on the scan results of around 60 antiviral scanners. Unfortunately, there are no standards on how to best interpret the scan results acquired from VirusTotal, which leads to the utilization of different threshold-based labeling strategies (e.g., if ten or more scanners deem an app malicious, it is considered malicious). While some of the utilized thresholds may be able to accurately approximate the ground truths of apps, the fact that VirusTotal changes the set and versions of the scanners it uses makes such thresholds unsustainable over time. We implemented a method, Maat, that tackles these issues of standardization and sustainability by automatically generating a Machine Learning (ML)-based labeling scheme, which outperforms threshold-based labeling strategies. Using the VirusTotal scan reports of 53K Android apps that span one year, we evaluated the applicability of Maat's ML-based labeling strategies by comparing their performance against threshold-based strategies. We found that such ML-based strategies (a) can accurately and consistently label apps based on their VirusTotal scan reports, and (b) contribute to training ML-based detection methods that are more effective at classifying out-of-sample apps than their threshold-based counterparts.
연구 동기 및 목표
- VirusTotal 스캔 보고서를 활용한 표준화되고 지속 가능한 Android 악성코드 레이블링 전략의 부족을 해결한다.
- VirusTotal의 동적 스캐너 세트 및 버전 변경으로 인한 임계값 기반 레이블링의 불안정성을 극복한다.
- 연구용 데이터셋에 대해 신뢰할 수 있고 시간에 따라 일관된 레이블링 전략을 자동으로 생성하는 방법을 개발한다.
- 기계학습 기반 레이블링이 임계값 기반 방법에 비해 후속 악성코드 탐지 모델의 성능을 향상시키는지 평가한다.
- VirusTotal를 활용한 보다 효과적인 악성코드 분석을 위한 스캐너의 정확성과 안정성에 대한 실질적인 통찰을 제공한다.
제안 방법
- 2018–2019년 13개월 동안 약 53,000개의 Android 앱에 대한 VirusTotal 스캔 보고서를 수집하고 분석한다.
- 스캐너 출력 및 집계 통계와 같은 특징을 스캔 보고서에서 추출하여 기계학습 모델을 훈련시킨다.
- 스캐너 신호를 기반으로 앱 레이블(악성/정상)을 예측할 수 있는 기계학습 모델(예: 랜덤 포레스트 또는 유사 모델)을 훈련시킨다.
- 확신도 점수를 사용하여 레이블 안정성을 평가하고, 시간에 따라 일관되게 신뢰할 수 있는 스캐너를 식별한다.
- 성능 지표를 사용하여 다양한 임계값 기반 전략(예: ≥1, ≥2, ≥10 스캐너)과 기계학습 기반 레이블링 전략을 비교한다.
- 검증용 테스트 세트를 사용하여 기계학습 기반 레이블링이 후속 탐지 모델(예: Drebin 분류기) 훈련에 미치는 영향을 평가한다.
실험 결과
연구 질문
- RQ1VirusTotal이 스캐너 세트를 동적으로 변경할 경우, 임계값 기반 레이블링 전략은 어떻게 성능을 보이는가?
- RQ2기계학습 기반 레이블링 전략을 자동으로 생성하여 임계값 기반 방법보다 더 정확하고 안정적인 레이블을 도출할 수 있는가?
- RQ3VirusTotal에서 Android 악성코드를 탐지하는 데 있어 어떤 스캐너들이 다양한 데이터셋과 시간대에 걸쳐 일관되게 정확하고 안정적인가?
- RQ4기계학습 기반 레이블링을 사용할 경우, 임계값 기반 레이블링에 비해 후속 악성코드 탐지 모델의 성능이 향상되는가?
- RQ5레이블 안정성과 VirusTotal 스캔 보고서의 레이블 정확성 간 상관관계는 어느 정도인가?
주요 결과
- Maat의 기계학습 기반 레이블링 전략은 VirusTotal의 동적 스캐너 세트로 인해 성능이 저하되는 임계값 기반 전략과 달리 시간에 따라 일관되게 높은 정확도를 유지한다.
- 모든 평가 시간 창에서 기계학습 기반 레이블링 전략은 최고 성능을 보인 임계값 기반 전략(예: ≥10 스캐너)보다 레이블링 정확도에서 뛰어나다.
- 모든 데이터셋에 대해 정확한 유일한 스캐너 조합은 존재하지 않으며, 최적의 스캐너 조합은 데이터셋 구성과 시간대에 따라 달라진다.
- BitDefender 및 기타 스캐너들이 VirusTotal에 의해 더 효과가 낮은 버전으로 교체되어 Android 악성코드 탐지 정확도가 떨어졌다.
- 다수의 스캐너는 시간에 따라 안정적인 레이블을 유지하지만, 레이블 안정성은 정확성을 보장하지는 않으며, 일부 안정적인 스캐너는 정확도가 떨어진다.
- Maat가 생성한 레이블을 기반으로 훈련된 악성코드 탐지 모델(예: Drebin 분류기)은 임계값 기반 레이블링을 기반으로 훈련된 모델보다 검증용 외부 악성코드에 대해 유의미하게 높은 분류 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.