[论文解读] FEEBO: An Empirical Evaluation Framework for Malware Behavior Obfuscation
FEEBO 是一种新颖的实验框架,通过系统性地混淆恶意软件二进制文件的系统调用行为,评估基于 n-gram 的行为检测技术的鲁棒性。结果表明,此类检测方法对行为混淆极为敏感,插入、重排或组合变换下精确率显著下降,表明其在面对真实世界混淆策略时鲁棒性有限。
Program obfuscation is increasingly popular among malware creators. Objectively comparing different malware detection approaches with respect to their resilience against obfuscation is challenging. To the best of our knowledge, there is no common empirical framework for evaluating the resilience of malware detection approaches w.r.t. behavior obfuscation. We propose and implement such a framework that obfuscates the observable behavior of malware binaries. To assess the framework's utility, we use it to obfuscate known malware binaries and then investigate the impact on detection effectiveness of different $n$-gram based detection approaches. We find that the obfuscation transformations employed by our framework significantly affect the precision of such detection approaches. Several $n$-gram-based approaches can hence be concluded not to be resilient against this simple kind of obfuscation.
研究动机与目标
- 为解决缺乏标准化实验框架以评估恶意软件检测对行为混淆的鲁棒性这一问题。
- 实现基于 n-gram 的方法中行为混淆对检测精确率影响的可复现实验。
- 在已知恶意软件样本上模拟真实世界的混淆技术,如系统调用插入、重排和替换。
- 评估这些混淆技术在保持恶意软件功能的同时规避行为检测的有效性。
- 为未来研究在不断演化的混淆技术下检测的鲁棒性提供基础。
提出的方法
- FEEBO 以已知的恶意软件二进制文件为输入,对其外部可见的系统调用序列应用受控的混淆变换。
- 利用 Intel Pin 对执行过程中的系统调用轨迹进行插桩和监控,从而实现对行为修改的精确控制。
- 混淆技术包括插入虚假系统调用、重排现有调用,以及用语义等价的调用进行替换。
- 该框架为每个恶意软件样本生成多个混淆变体,变换的强度和组合方式各不相同。
- 使用基于 n-gram 的分类器(如 n-gram 频率模型)对原始和混淆后的轨迹评估检测精确率。
- 采用饱和度方法确保在混淆谱系中实现多样化且密集的采样,利用 Levenshtein 距离度量行为差异。
实验结果
研究问题
- RQ1常见的行为混淆技术(如系统调用插入和重排)在多大程度上影响基于 n-gram 的行为检测系统的检测精确率?
- RQ2多种混淆技术的组合(如插入与重排)与单一技术相比,对检测鲁棒性的影响如何?
- RQ3基于 n-gram 的检测方法是否对语义等价的系统调用替换具有鲁棒性,且能保持恶意软件功能?
- RQ4混淆轨迹的密度和分布如何影响不同混淆配置下检测评估的可靠性?
- RQ5当真实标签变得稀缺时,在混淆的恶意软件样本上训练分类器有何影响?
主要发现
- FEEBO 每个样本成功生成了 375 种不同的混淆变体,且在混淆谱系中具有高密度,尤其在插入与重排组合配置下表现突出。
- 在行为混淆下,基于 n-gram 的检测方法精确率显著下降,其中插入与重排组合场景的退化最为严重。
- 即使在最小程度的混淆下,n-gram 模型的检测精确率也大幅降低,表明其对行为扰动高度敏感。
- 该框架的混淆变换在所有测试案例中均保持了恶意软件的功能性,因为所有混淆样本在执行期间均未崩溃,支持了评估的有效性。
- 底层分类器的选择(如朴素贝叶斯、SVM、随机森林)并未显著改变 n-gram 方法对混淆的相对敏感性,表明 n-gram 建模方法本身存在根本性缺陷。
- 本研究揭示了一个关键缺口:当前的行为检测系统对简单但有效的运行时行为混淆不具备鲁棒性,对实际部署构成严重担忧。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。