Skip to main content
QUICK REVIEW

[论文解读] MERLIN -- Malware Evasion with Reinforcement LearnINg

Tony Quertier, Benjamin Marais|arXiv (Cornell University)|Mar 24, 2022
Advanced Malware Detection Techniques被引用 8
一句话总结

该论文提出MERLIN,一种基于强化学习的框架,结合DQN与REINFORCE算法,通过语义保持的Windows PE文件修改,实现对基于机器学习的恶意软件检测器(MalConv、EMBER)及商用杀毒软件的绕过。REINFORCE在最先进的模型上实现超过75%的绕过率,并在商用杀毒软件上取得显著成功,同时生成详细的漏洞报告,以辅助防御加固。

ABSTRACT

In addition to signature-based and heuristics-based detection techniques, machine learning (ML) is widely used to generalize to new, never-before-seen malicious software (malware). However, it has been demonstrated that ML models can be fooled by tricking the classifier into returning the incorrect label. These studies, for instance, usually rely on a prediction score that is fragile to gradient-based attacks. In the context of a more realistic situation where an attacker has very little information about the outputs of a malware detection engine, modest evasion rates are achieved. In this paper, we propose a method using reinforcement learning with DQN and REINFORCE algorithms to challenge two state-of-the-art ML-based detection engines (MalConv \& EMBER) and a commercial AV classified by Gartner as a leader AV. Our method combines several actions, modifying a Windows portable execution (PE) file without breaking its functionalities. Our method also identifies which actions perform better and compiles a detailed vulnerability report to help mitigate the evasion. We demonstrate that REINFORCE achieves very good evasion rates even on a commercial AV with limited available information.

研究动机与目标

  • 开发一种自动化、黑盒化的检测方法,以在极少先验知识的前提下绕过现代基于机器学习和商用杀毒软件的恶意软件检测系统。
  • 识别并分析有效、功能保持的PE文件修改方式,使其在保持恶意行为的同时绕过检测。
  • 生成可操作的漏洞报告,解释绕过成功的原因,并支持检测引擎的加固。
  • 评估不同强化学习算法(DQN与REINFORCE)在低信息、黑盒绕过场景下的有效性。
  • 通过系统化的对抗性测试与可解释的绕过模式,揭示检测引擎的结构性弱点。

提出的方法

  • 采用自定义环境模拟黑盒恶意软件检测API,仅返回良性/恶意标签,构建强化学习框架。
  • 使用DQN与REINFORCE算法学习对PE文件执行二进制修改操作的最优序列,无需模型梯度或内部得分信息。
  • 应用语义保持的操作,如修改机器类型、添加良性库、更改时间戳,以及插入来自良性文件的字符串。
  • 通过验证修改后二进制文件在修改后仍保持原始恶意行为,确保功能等价性。
  • 生成详细的漏洞报告,追踪所有操作及其影响与对绕过成功的贡献。
  • 可视化攻击过程的演化与操作有效性的变化,以支持可解释性与防御分析。

实验结果

研究问题

  • RQ1强化学习能否在黑盒环境下有效生成对抗性PE文件,以绕过最先进的基于机器学习的恶意软件检测器(MalConv、EMBER)及商用杀毒软件?
  • RQ2当仅能获取硬标签(良性/恶意)时,DQN与REINFORCE在绕过成功率与鲁棒性方面表现如何比较?
  • RQ3哪些具体的二进制修改操作最有效实现绕过?它们如何共同作用以规避检测?
  • RQ4生成的漏洞报告能否提供可操作的洞察,以提升检测引擎的韧性?
  • RQ5操作序列在绕过过程中有多重要?REINFORCE建模序列的能力为何优于DQN仅关注单个操作结果的表现?

主要发现

  • REINFORCE在MalConv与EMBER上实现超过75%的绕过率,证明其在低信息黑盒环境下的强大性能。
  • 在商用杀毒软件上,尽管信息有限,REINFORCE仍取得显著的绕过成功,优于DQN,甚至在某些情况下超越随机搜索。
  • DQN在商用杀毒软件上的表现较差,因其无法有效建模操作序列,仅依赖最终操作结果。
  • ‘修改机器类型’这一操作在成功绕过序列中频繁出现,表明其可能是检测引擎中的关键弱点。
  • 漏洞报告提供了关于哪些修改导致绕过的详细、可解释的洞察,支持针对性的防御改进。
  • 该框架成功生成了功能完整且未被检测到的恶意软件变体,可用于重新训练检测模型以提升鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。