[论文解读] Android Malware Detection using Feature Ranking of Permissions
本文提出了一种基于权限的 Android 恶意软件检测框架,通过卡方检验和费雪精确检验进行特征排序以减少无关权限,随后使用随机森林进行分类,在完整 Drebin 数据集上实现了 99.34% 的准确率和 92.17% 的 F1 分数,优于以往仅基于权限的方法。
We investigate the use of Android permissions as the vehicle to allow for quick and effective differentiation between benign and malware apps. To this end, we extract all Android permissions, eliminating those that have zero impact, and apply two feature ranking algorithms namely Chi-Square test and Fisher's Exact test to rank and additionally filter them, resulting in a comparatively small set of relevant permissions. Then we use Decision Tree, Support Vector Machine, and Random Forest Classifier algorithms to detect malware apps. Our analysis indicates that this approach can result in better accuracy and F-score value than other reported approaches. In particular, when random forest is used as the classifier with the combination of Fisher's Exact test, we achieve 99.34\% in accuracy and 92.17\% in F-score with the false positive rate of 0.56\% for the dataset in question, with results improving to 99.82\% in accuracy and 95.28\% in F-score with the false positive rate as low as 0.05\% when only malware from three most popular malware families are considered.
研究动机与目标
- 通过仅从 Android 清单文件中提取的权限,提升 Android 恶意软件检测的准确率和 F1 分数。
- 通过消除无关权限并使用统计特征选择方法对剩余权限进行排序,降低特征维度。
- 评估不同机器学习分类器(决策树、支持向量机和随机森林)在排序后的权限特征上的表现。
- 在准确率、F1 分数和误报率方面,将所提方法与现有基于权限和混合型(权限+代码)的恶意软件检测方法进行比较。
- 证明无论其风险类别(普通、危险或签名)如何,仅关注相关权限即可实现更优的检测性能。
提出的方法
- 从 Drebin 数据集中 119,808 个应用(114,298 个良性应用,5,510 个恶意软件)的清单文件中提取 Android 权限。
- 通过统计显著性检验移除对恶意软件分类无影响的权限。
- 应用卡方检验和费雪精确检验,根据 p 值对权限进行排序,仅选择与恶意软件类别具有强关联性的权限。
- 在过滤并排序后的权限集合上使用三种分类器——决策树、支持向量机(SVM)和随机森林。
- 使用标准指标(准确率、F1 分数和误报率)在两个数据集上评估性能:完整 Drebin 数据集和仅包含三种最常见恶意软件家族的子集。
- 与最先进的基于权限和混合型(权限+代码)方法的结果进行比较,以验证其优越性。
实验结果
研究问题
- RQ1与未经筛选的权限集合相比,使用统计检验对 Android 权限进行特征排序是否能提升恶意软件检测的准确率?
- RQ2卡方检验和费雪精确检验在识别对恶意软件检测最具区分性的权限方面表现如何?
- RQ3当应用于排序后的权限特征时,随机森林分类器是否优于决策树和 SVM?
- RQ4当仅聚焦于三种最普遍的恶意软件家族时,检测性能如何变化?
- RQ5在基于权限的恶意软件检测中,移除无关权限在多大程度上提升了 F1 分数并降低了误报率?
主要发现
- 所提方法在完整 Drebin 数据集上使用费雪精确检验和随机森林,实现了 99.34% 的准确率和 92.17% 的 F1 分数。
- 当限制在三种最常见恶意软件家族时,准确率提升至 99.82%,F1 分数提升至 95.28%,误报率低至 0.05%。
- 该方法优于 Drebin 原始方法(完整数据集上准确率为 93.90%)及其他仅基于权限的方法,包括使用序列前向选择和主成分分析(PCA)的方法。
- 尽管 F1 分数更高(92.17% 对比 91%),其误报率显著更低(0.56% 对比 0.60%),优于同类研究。
- 由于去除了无关权限并采用统计排序,该模型优于 APK Auditor(准确率为 88%)。
- 尽管使用源代码的混合方法实现了略高的 F1 分数(95.6%),但其测试数据集规模小得多(仅 387 个应用),因此本方法在大规模数据上更具可扩展性和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。