[论文解读] Novel Feature Extraction, Selection and Fusion for Effective Malware Family Classification
该论文提出了一种轻量级、高精度的恶意软件家族分类系统,通过从可移植可执行(PE)文件中提取新颖的结构特征,无需解包或去混淆即可实现分类。通过采用基于每类加权策略的融合方法,并结合XGBoost与袋装技术,该方法在Microsoft恶意软件分类挑战数据集上实现了99.8%的准确率,优于复杂模型,且计算成本显著降低。
Modern malware is designed with mutation characteristics, namely polymorphism and metamorphism, which causes an enormous growth in the number of variants of malware samples. Categorization of malware samples on the basis of their behaviors is essential for the computer security community, because they receive huge number of malware everyday, and the signature extraction process is usually based on malicious parts characterizing malware families. Microsoft released a malware classification challenge in 2015 with a huge dataset of near 0.5 terabytes of data, containing more than 20K malware samples. The analysis of this dataset inspired the development of a novel paradigm that is effective in categorizing malware variants into their actual family groups. This paradigm is presented and discussed in the present paper, where emphasis has been given to the phases related to the extraction, and selection of a set of novel features for the effective representation of malware samples. Features can be grouped according to different characteristics of malware behavior, and their fusion is performed according to a per-class weighting paradigm. The proposed method achieved a very high accuracy ($\approx$ 0.998) on the Microsoft Malware Challenge dataset.
研究动机与目标
- 为在不进行去混淆或解包的情况下,高效分类多态性和变态型恶意软件变种提供解决方案。
- 设计一组紧凑但具有区分性的结构特征,以捕捉PE文件的内在特性,从而提升分类性能。
- 在最小化计算复杂度的前提下实现高分类准确率,以利于工业部署。
- 通过减少特征集规模,实现可解释的恶意软件分类,相较于复杂模型更具可解释性。
- 在真实反恶意软件场景中评估系统的鲁棒性与实用性。
提出的方法
- 从恶意软件样本中提取基于内容的特征,如字节码n-gram、操作码n-gram以及API调用序列。
- 提出新型的统计特征,反映PE文件的结构布局,包括节和头部的熵值及分布模式。
- 应用前向逐步特征选择算法,识别最具相关性的特征类别,在准确率与特征数量之间实现平衡。
- 采用基于每类加权的范式融合特征,以突出家族特定的区分性信号。
- 使用XGBoost结合袋装作为分类器,优先考虑效率与鲁棒性,而非复杂的集成架构。
- 通过仅依赖原始二进制文件和反汇编代码的静态分析,避免了解包与去混淆。
实验结果
研究问题
- RQ1是否可以通过PE文件的新颖结构特征,在无需解包或去混淆的情况下提升恶意软件家族分类的准确率?
- RQ2内容型与结构型特征的融合如何影响分类性能?
- RQ3在恶意软件家族分类中,特征集大小与分类准确率之间的权衡关系如何?
- RQ4与最先进方法相比,特别是Microsoft恶意软件挑战赛的优胜方案,该方法在性能与复杂度方面表现如何?
- RQ5鉴于该系统的设计目标是分类而非检测,其在面对欺骗或投毒攻击时的鲁棒性如何?
主要发现
- 所提方法在Microsoft恶意软件分类挑战数据集上实现了约0.998的分类准确率,与优胜团队的0.9983结果相当。
- 在测试数据上,模型的logloss为0.0028,表明其具有良好的泛化能力与模型校准性。
- 与优胜方案相比,该方法的计算复杂度显著降低,后者依赖于计算密集型的n-gram特征与复杂集成。
- 通过使用新颖的结构特征,系统在无需解包的情况下有效分类了加壳与混淆的恶意软件,同时保持了高性能。
- 前向特征选择过程有效减少了特征数量,同时维持了高准确率,提升了可解释性。
- 由于高准确率与低计算成本的平衡,该系统非常适合工业部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。