[论文解读] Context-aware, Adaptive and Scalable Android Malware Detection through Online Learning (extended version)
该论文提出 Casandra,一种上下文感知、自适应且可扩展的在线学习框架,用于 Android 恶意软件检测,采用一种新颖的图核来捕捉程序依赖图中的安全敏感行为和上下文依赖关系。在基准数据集上达到 99.23% 的 F1 值,在真实世界应用上达到 89.92% 的准确率,相较于最先进方法在批量学习设置下提升超过 25%,在持续保留设置下提升超过 7%。
It is well-known that Android malware constantly evolves so as to evade detection. This causes the entire malware population to be non-stationary. Contrary to this fact, most of the prior works on Machine Learning based Android malware detection have assumed that the distribution of the observed malware characteristics (i.e., features) does not change over time. In this work, we address the problem of malware population drift and propose a novel online learning based framework to detect malware, named CASANDRA (Contextaware, Adaptive and Scalable ANDRoid mAlware detector). In order to perform accurate detection, a novel graph kernel that facilitates capturing apps' security-sensitive behaviors along with their context information from dependency graphs is proposed. Besides being accurate and scalable, CASANDRA has specific advantages: i) being adaptive to the evolution in malware features over time ii) explaining the significant features that led to an app's classification as being malicious or benign. In a large-scale comparative analysis, CASANDRA outperforms two state-of-the-art techniques on a benchmark dataset achieving 99.23% F-measure. When evaluated with more than 87,000 apps collected in-the-wild, CASANDRA achieves 89.92% accuracy, outperforming existing techniques by more than 25% in their typical batch learning setting and more than 7% when they are continuously retained, while maintaining comparable efficiency.
研究动机与目标
- 应对 Android 恶意软件群体持续演化和特征漂移带来的非平稳性挑战。
- 克服批量学习模型假设数据分布静态、无法适应恶意软件特征演变的局限性。
- 开发一种可扩展且可解释的恶意软件检测系统,在概念漂移存在的情况下仍能长期保持高准确率。
- 从程序依赖图中整合上下文信息,以提升对抵抗语法混淆的语义恶意行为的检测能力。
- 实现实时、自适应学习,持续更新模型以纳入新恶意样本,而无需从头开始重新训练。
提出的方法
- 提出一种新颖的上下文感知加权图核(CWLK),通过在程序依赖图中引入上下文邻域标签序列,扩展 Weisfeiler-Lehman 核。
- 采用显式特征映射将图表示为向量,通过特征重要性分析实现高效计算与可解释性。
- 应用在线学习机制,随着新恶意样本的到达持续更新分类器,无需在完整历史数据集上重新训练即可适应概念漂移。
- 利用程序表示图(PRGs),如控制流图、数据流图和程序依赖图,捕捉对代码混淆具有鲁棒性的语义行为。
- 集成基于词汇的特征提取机制,识别并排序对恶意分类贡献最大的子结构(例如,API 调用序列)。
- 将 CWLK 核与基于核的分类器(如 SVM)结合,以在线、增量方式执行图分类。
实验结果
研究问题
- RQ1恶意软件检测系统如何有效适应不断演化的 Android 恶意软件群体的非平稳性?
- RQ2与标准图核相比,从程序依赖图中整合上下文信息在多大程度上提升了检测准确率?
- RQ3在线学习框架能否在处理大规模真实世界应用流时,长期保持高检测性能?
- RQ4所提出的上下文感知图核相较于现有图核,在可扩展性、准确率和可解释性方面表现如何?
- RQ5在概念漂移存在的情况下,持续模型更新对检测性能有何影响?
主要发现
- Casandra 在基准数据集上达到 99.23% 的 F1 值,优于两种最先进批量学习技术。
- 在包含超过 87,000 个真实世界 Android 应用的现实世界数据集上,Casandra 达到 89.92% 的准确率,相较于现有方法在标准批量学习设置下提升超过 25%。
- 当现有方法被调整为持续保留设置(即使用新数据重新训练)时,Casandra 仍以超过 7% 的准确率优势胜出。
- 所提出的上下文感知图核(CWLK)通过识别并排序对分类决策具有决定性作用的关键上下文特征序列,实现了可解释的检测。
- 该框架在计算效率方面表现优异,每次迭代的时间复杂度为 O(he),与标准 Weisfeiler-Lehman 核一致,确保可扩展至大规模应用仓库。
- CWLK 中采用的显式特征映射同时支持可扩展性与可解释性,可实现对恶意软件行为模式的特征级别分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。