[论文解读] Heterogeneous Graph Matching Networks
本文提出 MatchGNet,一种异质图匹配网络,通过图神经网络同时学习程序行为表征与相似性度量,以检测未知恶意软件。通过将执行行为建模为不变异质图,并采用具有分层注意力机制的孪生网络,MatchGNet 相较于最先进方法将误报率降低 50%,同时在恶意软件检测中实现零误报。
Information systems have widely been the target of malware attacks. Traditional signature-based malicious program detection algorithms can only detect known malware and are prone to evasion techniques such as binary obfuscation, while behavior-based approaches highly rely on the malware training samples and incur prohibitively high training cost. To address the limitations of existing techniques, we propose MatchGNet, a heterogeneous Graph Matching Network model to learn the graph representation and similarity metric simultaneously based on the invariant graph modeling of the program's execution behaviors. We conduct a systematic evaluation of our model and show that it is accurate in detecting malicious program behavior and can help detect malware attacks with less false positives. MatchGNet outperforms the state-of-the-art algorithms in malware detection by generating 50% less false positives while keeping zero false negatives.
研究动机与目标
- 为解决基于签名与基于行为的恶意软件检测方法的局限性,特别是其无法检测未知或零日恶意软件的问题。
- 克服检测未知程序所面临的挑战,包括复杂的异质依赖关系、缺乏内在相似性度量、事件空间庞大以及程序别名等问题。
- 开发一种仅从良性程序中学习的数据驱动模型,实现无需恶意软件训练样本即可检测未知恶意行为。
- 在保持零误报的前提下最小化误报。
- 通过图表示学习与孪生网络改进程序执行轨迹之间的相似性学习。
提出的方法
- 构建一个不变异质图,以建模程序执行轨迹中系统实体(如系统调用、文件操作)之间的非线性、分层依赖关系。
- 设计一种分层注意力图神经编码器,从异质图结构中学习上下文相关的节点表征。
- 采用孪生网络架构,联合训练图编码器并学习未知程序与已知良性程序之间的相似性度量。
- 仅使用良性程序执行数据进行模型训练,避免使用任何恶意软件样本,以提升对未知威胁的泛化能力。
- 在训练过程中使用对比损失优化相似性得分,使模型能够基于结构与语义相似性区分恶意与良性行为。
- 通过将已训练模型应用于未知程序,计算其与已知良性程序的相似性得分,并在相似性低于阈值时触发警报。
实验结果
研究问题
- RQ1基于图的表示学习模型能否有效捕捉程序执行行为中复杂的异质依赖关系,以实现恶意软件检测?
- RQ2如何从良性程序数据中端到端学习相似性度量,以检测未知恶意程序而无需使用标注的恶意软件样本?
- RQ3与现有最先进方法相比,异质图匹配网络在真实恶意软件检测中能将误报率降低多少?
- RQ4在图神经网络中引入分层注意力是否能提升模型识别良性与恶意程序之间细微行为差异的能力?
- RQ5该模型能否在包含多样化恶意软件家族与复杂攻击链的真实攻击场景中实现良好泛化?
主要发现
- MatchGNet 在已知恶意软件检测中达到 99% 的 AUC,优于所有基线方法至少 4 个百分点。
- 在检测未知程序时,MatchGNet 的准确率达到 96%,较支持向量机(SVM)高出 46%,较逻辑回归高出 14%。
- 与最先进基线相比,MatchGNet 将误报率降低 50%——从 115 例降至 57 例,同时在企业攻击模拟中仍捕获全部 154 个真实恶意软件警报。
- MatchGNet 的最优超参数为 3 层与 500 个隐藏神经元,可在最小资源开销下最大化 AUC 并防止过拟合。
- 该模型在所有评估设置中均保持零误报,展现出在识别恶意行为方面的强大可靠性。
- 图编码器中使用分层注意力显著提升了语义特征学习效果,从而实现更准确、更鲁棒的相似性评分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。