[论文解读] HAWK: Rapid Android Malware Detection through Heterogeneous Graph Attention Networks
Hawk 提出了一种新颖的、增量式的 Android 恶意软件检测框架,利用异构图注意力网络(HAWK)将 Android 实体及其行为关系建模为异构信息网络(HIN)。通过采用基于元路径和元图的图注意力网络(MsGAT 和增量式 MsGAT++),Hawk 实现了对未见应用的快速、准确检测,准确率达到 99.2%,平均推理时间为 3.5ms,训练速度比之前的方法快 50 倍。
Android is undergoing unprecedented malicious threats daily, but the existing methods for malware detection often fail to cope with evolving camouflage in malware. To address this issue, we present HAWK, a new malware detection framework for evolutionary Android applications. We model Android entities and behavioural relationships as a heterogeneous information network (HIN), exploiting its rich semantic metastructures for specifying implicit higher-order relationships. An incremental learning model is created to handle the applications that manifest dynamically, without the need for re-constructing the whole HIN and the subsequent embedding model. The model can pinpoint rapidly the proximity between a new application and existing in-sample applications and aggregate their numerical embeddings under various semantics. Our experiments examine more than 80,860 malicious and 100,375 benign applications developed over a period of seven years, showing that HAWK achieves the highest detection accuracy against baselines and takes only 3.5ms on average to detect an out-of-sample application, with the accelerated training time of 50x faster than the existing approach.
研究动机与目标
- 解决通过动态、可扩展学习检测能够绕过传统基于签名和特征检测的演化型 Android 恶意软件的挑战。
- 克服现有异构信息网络(HIN)模型静态特性的问题,这些模型无法在不完全重新训练的情况下高效处理未见应用。
- 开发一种增量学习机制,实现在无需重建整个 HIN 或嵌入模型的情况下,对新 Android 应用进行快速检测。
- 利用 HIN 中丰富的语义元结构,捕捉 Android 实体(如权限、API 和类)之间的高阶隐式关系。
- 实现实时大规模 Android 生态系统中部署所需的高检测准确率和低推理延迟。
提出的方法
- 通过反编译 APK 提取七类实体(应用、权限、权限类型、API、类、接口和 .so 文件),将 Android 应用建模为异构信息网络(HIN)。
- 定义元路径和元图以捕捉实体之间的高阶语义关系,例如反映行为模式的 App–Permission–API–App 链。
- 设计 MsGAT(多语义图注意力网络)通过可学习的注意力权重,在不同元结构内部及之间聚合邻居嵌入。
- 开发增量式 MsGAT++,通过重用现有 HIN 嵌入,无需完全重新训练即可实现对未见应用的高效表示学习。
- 利用图注意力机制,根据语义相关性动态加权邻近节点的重要性,从而提升表示质量。
- 将学习到的嵌入集成到分类器中用于恶意软件检测,实现归纳性、可扩展且快速的未见应用推理。
实验结果
研究问题
- RQ1异构信息网络(HIN)能否有效建模 Android 实体之间的复杂隐式关系,从而在超越传统特征工程的基础上提升恶意软件检测效果?
- RQ2如何使基于 HIN 的模型具备增量特性,以支持在不完全重新训练的情况下实时检测新出现的未见 Android 应用?
- RQ3图注意力网络(GATs)在多源邻域信息自适应聚合方面,能在多大程度上增强 HIN 中的表示学习?
- RQ4所提出的增量学习机制能否在大规模 Android 恶意软件检测中同时实现高检测准确率和低推理延迟?
- RQ5该框架在检测使用混淆或重打包技术以逃避传统检测的演化型恶意软件方面表现如何?
主要发现
- Hawk 在一个包含超过 18.1 万个 Android 应用(80,860 个恶意,100,375 个良性)的数据集上实现了 99.2% 的检测准确率,优于所有基线方法。
- 检测一个新未见应用的平均推理时间仅为 3.5ms,表明其具备高度的高速部署潜力。
- 与之前最先进的方法(AiDroid)相比,Hawk 将训练时间减少了 50 倍,显著提升了可扩展性和效率。
- 增量式 MsGAT++ 模型通过重用现有 HIN 嵌入,实现了对新应用的快速检测,避免了对图和嵌入模型的完整重建。
- 元路径和元图的使用使 Hawk 能够捕捉高阶隐式关系(例如 App1–Permission–App2),这些关系是传统基于特征的方法无法检测到的。
- 由于能够建模超越显式特征的语义关系,该框架对演化型恶意软件(包括混淆和重打包变体)表现出强大的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。