[논문 리뷰] FeatureAnalytics: An approach to derive relevant attributes for analyzing Android Malware
이 논문은 애자일 악성 소프트웨어 탐지에 가장 분류 능력이 뛰어난 시스템 호출을 식별하기 위해 날카로운 집합 이론과 대규모 인구 시험(LPT)을 조합한 이단계 특성 선택 방법인 RSST를 제안한다. 30개 최적의 시스템 호출을 감소시킴으로써, 이 방법은 오직 1%의 거짓 양성 비율로 99.9%의 정확도와 1.0 AUC를 달성하며, 기존의 특성 선택기와 허가, API와 같은 정적 특성보다 뛰어난 성능을 보인다.
Ever increasing number of Android malware, has always been a concern for cybersecurity professionals. Even though plenty of anti-malware solutions exist, a rational and pragmatic approach for the same is rare and has to be inspected further. In this paper, we propose a novel two-set feature selection approach based on Rough Set and Statistical Test named as RSST to extract relevant system calls. To address the problem of higher dimensional attribute set, we derived suboptimal system call space by applying the proposed feature selection method to maximize the separability between malware and benign samples. Comprehensive experiments conducted on a dataset consisting of 3500 samples with 30 RSST derived essential system calls resulted in an accuracy of 99.9%, Area Under Curve (AUC) of 1.0, with 1% False Positive Rate (FPR). However, other feature selectors (Information Gain, CFsSubsetEval, ChiSquare, FreqSel and Symmetric Uncertainty) used in the domain of malware analysis resulted in the accuracy of 95.5% with 8.5% FPR. Besides, empirical analysis of RSST derived system calls outperform other attributes such as permissions, opcodes, API, methods, call graphs, Droidbox attributes and network traces.
연구 동기 및 목표
- 애자일 악성 소프트웨어 탐지에서 고차원적이고 노이즈가 많은 특성 공간의 과제를 해결하기 위해.
- 악성 및 양성 애플리케이션을 가장 잘 분리하는 최소의 최적의 시스템 호출 집합을 식별하기 위해.
- 특성 선택을 위해 날카로운 집합 이론과 통계적 테스트를 조합함으로써 분류 성능을 향상시키기 위해.
- 허가, API, Droidbox 트레이스와 같은 전통적인 정적 특성과 비교하여 시스템 호출 기반 특성의 우수성을 평가하기 위해.
- 동적 분석과 머신러닝을 활용한 강력하고 고정확도의 탐지 프레임워크를 개발하기 위해.
제안 방법
- 분류 정확도를 유지하는 최소한의 시스템 호출 부분집합인 리듀크트를 식별함으로써, 날카로운 집합 이론을 적용하여 初기 특성 선택을 수행한다.
- 비모수적 통계 테스트인 대규모 인구 시험(LPT)을 사용하여 악성 샘플과 양성 샘플 간의 분류 능력에 따라 선택된 시스템 호출을 순위 매기고 정제한다.
- 응용 프로그램 동작을 나타내기 위해 RSST 과정에서 유도된 30개의 시스템 호출로 구성된 최종 특성 벡터를 구축한다.
- 선택된 시스템 호출 특성에 대해 분류기(AdaBoostM1-J48, 랜덤 포레스트, 로테이션 포레스트)를 훈련하고 평가한다.
- 정보 이득, 카이제곱, 대칭 불확실성, CFsSubsetEval, FreqSel과 같은 전통적인 특성 선택기와 성능을 비교한다.
- 비교 분석을 위해 시스템 호출 특성과 다른 동적 및 정적 속성(예: 네트워크 트레이스, 콜 그래프, Droidbox)을 통합한다.
실험 결과
연구 질문
- RQ1날카로운 집합 이론과 통계적 테스트를 조합한 하이브리드 특성 선택 접근법이 악성 소프트웨어 탐지 정확도를 향상시킬 수 있는가?
- RQ2전통적인 정적 특성(예: 허가, API)과 비교할 때, 시스템 호출 기반 특성은 악성 앱과 양성 앱을 얼마나 잘 구분하는가?
- RQ3낮은 거짓 양성 비율을 유지하면서 높은 탐지 정확도를 달성하기 위해 필요한 최적의 시스템 호출 수는 얼마인가?
- RQ4RSST 방법은 악성 소프트웨어 탐지 작업에서 표준 특성 선택 기법보다 뛰어나게 성능을 발휘하는가?
- RQ5시스템 호출 특성만으로도 애자일 악성 소프트웨어 탐지에서 거의 완벽한 분류 성능를 달성할 수 있는가?
주요 결과
- RSST 방법은 30개의 선택된 시스템 호출을 사용하여 99.9%의 탐지 정확도와 1.0 AUC, 오직 1%의 거짓 양성 비율을 기록했다.
- 제안된 방법은 기존의 특성 선택기들보다 뚜렷하게 뛰어났다: 정보 이득, CFsSubsetEval, 카이제곱, 대칭 불확실성은 각각 95.5%의 정확도와 8.5%의 FPR을 기록했다.
- 시스템 호출 기반 특성은 허가, API, Droidbox 속성과 같은 정적 특성보다 탐지 성능에서 뛰어났다.
- LPT 기반 특성 집합은 부분 평가에서 99.8%의 정확도와 0.001%의 거짓 양성 비율을 기록하여 높은 강건성을 보였다.
- 실증 분석을 통해 시스템 호출은 콜 그래프, 옵코드, 네트워크 트레이스보다 악성 소프트웨어 분류에 더 분류 능력이 뛰어나다는 것이 확인되었다.
- 본 연구는 동적 분석을 통해 시스템 호출을 사용하고, 지능적인 특성 선택을 병행할 경우 거의 완벽한 악성 소프트웨어 탐지가 가능하다는 것을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.