[논문 리뷰] Android Malware Category and Family Detection and Identification using Machine Learning
이 논문은 CCCS-CIC-AndMal2020 데이터셋을 사용하여 악성코드 카테고리 식별에서 96% 이상, 악성코드 패밀리 식별에서 99% 이상의 정확도를 달성하는 두 가지 기계학습 기반 동적 분석 방법을 제안한다. 이 방법은 런타임 실행 중에 추출한 행동 특징을 활용하여 대규모 스케일에서 고정밀도, 시간 효율적인 Android 악성코드 분류를 가능하게 한다.
Android malware is one of the most dangerous threats on the internet, and it's been on the rise for several years. Despite significant efforts in detecting and classifying android malware from innocuous android applications, there is still a long way to go. As a result, there is a need to provide a basic understanding of the behavior displayed by the most common Android malware categories and families. Each Android malware family and category has a distinct objective. As a result, it has impacted every corporate area, including healthcare, banking, transportation, government, and e-commerce. In this paper, we presented two machine-learning approaches for Dynamic Analysis of Android Malware: one for detecting and identifying Android Malware Categories and the other for detecting and identifying Android Malware Families, which was accomplished by analyzing a massive malware dataset with 14 prominent malware categories and 180 prominent malware families of CCCS-CIC-AndMal2020 dataset on Dynamic Layers. Our approach achieves in Android Malware Category detection more than 96 % accurate and achieves in Android Malware Family detection more than 99% accurate. Our approach provides a method for high-accuracy Dynamic Analysis of Android Malware while also shortening the time required to analyze smartphone malware.
연구 동기 및 목표
- 의료, 은행, 전자상거래와 같은 핵심 분야에서 증가하는 Android 악성코드 위협을 해결하기 위해.
- 주요 Android 악성코드 카테고리와 패밀리에 고유한 행동 패턴을 더 깊이 이해하기 위해.
- 동적 분석을 활용하여 대규모 스케일에서 Android 악성코드를 고정밀도로 분류할 수 있는 확장 가능한 방법을 개발하기 위해.
- 실제 운영 환경에서의 정밀도를 유지하면서 분석 시간을 단축하기 위해.
제안 방법
- 런타임 실행 중에 애플리케이션의 행동 특징을 추출하기 위해 동적 분석을 활용한다.
- CCS-CIC-AndMal2020 데이터셋에서 유래한 14개의 악성코드 카테고리와 180개의 악성코드 패밀리로 구성된 종합적인 데이터셋을 학습 및 평가에 사용한다.
- 악성코드 카테고리 식별과 악성코드 패밀리 식별을 위해 각각 별도의 지도 기반 기계학습 모델을 학습시킨다.
- 특징 공학은 실행 중 관찰된 시스템 수준의 API 호출, 권한, 네트워크 활동, 프로세스 행동에 중점을 둔다.
- 정밀도와 재현율을 최적화하기 위해 모델을 조정하며, 표준 분류 평가 지표를 사용해 성능을 평가한다.
- 최소한의 수동 간섭으로도 자동화되고 확장 가능한 분류 파이프라인을 제공한다.
실험 결과
연구 질문
- RQ1기계학습 모델은 사전 정의된 카테고리로 Android 악성코드를 높은 정확도로 분류할 수 있는가?
- RQ2동일한 접근 방식을 사용해 유사한 정밀도로 특정 악성코드 패밀리를 식별할 수 있는가?
- RQ3정적 분석만으로는 비교할 때 런타임 행동의 동적 분석이 탐지 정확도를 어떻게 향상시키는가?
- RQ4다양하고 대규모인 악성코드 데이터셋에 적용했을 때 제안된 방법의 확장성과 효율성은 어떠한가?
주요 결과
- 악성코드 카테고리 식별 모델은 CCCS-CIC-AndMal2020 데이터셋에서 96% 이상의 정확도를 달성했다.
- 악성코드 패밀리 식별 모델은 99%를 초과하는 정확도를 확보하여 개별 패밀리 식별에 높은 특이도를 보였다.
- 동적 분석 기반 접근은 높은 탐지 정밀도를 유지하면서도 수동 분석 시간을 크게 줄였다.
- 이 방법은 14개의 카테고리와 180개의 패밀리에 걸쳐 다양한 악성코드 행동을 효과적으로 구분할 수 있었으며, 강력한 일반화 능력을 보였다.
- 런타임 중에 추출된 행동 특징은 악성코드 분류에 매우 구분력이 높다는 것이 결과적으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.