Skip to main content
QUICK REVIEW

[论文解读] Living-off-the-Land Abuse Detection Using Natural Language Processing and Supervised Learning

Ryan Stamp|arXiv (Cornell University)|Aug 26, 2022
Advanced Malware Detection Techniques被引用 5
一句话总结

本文提出了一种新颖的监督学习方法,用于检测利用合法系统二进制文件(LOL)的滥用行为。通过自然语言处理技术——具体为正则表达式和独热编码——将命令字符串编码为数值标记向量,进而分类判断其是否存在恶意意图。该模型在虚拟环境中检测未曾见过的恶意命令时,表现优于Windows Defender,凸显了其有效性,尽管面临基础率谬误的挑战。

ABSTRACT

Living-off-the-Land is an evasion technique used by attackers where native binaries are abused to achieve malicious intent. Since these binaries are often legitimate system files, detecting such abuse is difficult and often missed by modern anti-virus software. This paper proposes a novel abuse detection algorithm using raw command strings. First, natural language processing techniques such as regular expressions and one-hot encoding are utilized for encoding the command strings as numerical token vectors. Next, supervised learning techniques are employed to learn the malicious patterns in the token vectors and ultimately predict the command's label. Finally, the model is evaluated using statistics from the training phase and in a virtual environment to compare its effectiveness at detecting new commands to existing anti-virus products such as Windows Defender.

研究动机与目标

  • 为应对日益增长的利用合法系统二进制文件(LOL)进行攻击的威胁,此类攻击使攻击者能够规避检测。
  • 通过自然语言处理建模恶意命令模式,克服基于签名检测方法的局限性。
  • 通过应用统计与过滤技术,降低高流量命令流中的误报率,同时正视基础率谬误的影响。
  • 设计一种模块化、可扩展的系统,能够在不重新训练整个模型的前提下,适应新的LOLBin和命令模式。
  • 通过检测对良性二进制文件(如certutil.exe和rundll32.exe)的恶意使用,提升终端安全防护能力。

提出的方法

  • 使用自定义正则表达式解析命令字符串,提取并规范化各类标记,如URL、文件路径、IP地址、GUID以及二进制文件特异性关键词。
  • 通过独热编码将标记转换为数值向量,以表示命令的语法与语义特征。
  • 在标注的命令数据上训练监督学习模型,基于标记模式将命令分类为良性或恶意。
  • 在虚拟环境中通过实时命令流对模型进行评估,测试其对未曾见过的恶意命令的检测能力。
  • 系统集成白名单机制与告警过滤,以减轻因基础率谬误导致的误报影响。
  • 架构设计为模块化,支持对不同LOLBin(如regsvr32、rundll32)独立更新检测规则,而不影响整体性能。

实验结果

研究问题

  • RQ1基于自然语言处理的标记化与独热编码能否有效表示利用合法系统二进制文件攻击中的恶意命令模式?
  • RQ2在标记化命令字符串上训练的监督学习模型,与传统杀毒软件(如Windows Defender)相比,在检测新型LOLBin滥用行为方面表现如何?
  • RQ3基础率谬误在高流量命令监控系统中对误报率的影响程度如何?
  • RQ4能否构建一个模块化、可扩展的检测系统,以支持不断演进的LOLBin技术,而无需重新训练整个模型?
  • RQ5过滤机制与白名单在减少实时检测中因误报导致的安全分析师工作负荷方面发挥何种作用?

主要发现

  • 该模型成功利用自然语言处理技术检测恶意命令模式,在虚拟环境中对未见过的命令实现了高检测准确率。
  • 该模型在识别传统签名检测方法无法覆盖的新型恶意命令方面,优于Windows Defender。
  • 基础率谬误显著提高了误报率,即使单个命令的误报率较低,但由于恶意命令在正常系统活动中的稀有性,整体误报率仍被大幅放大。
  • 尽管误报数量庞大,作者仍建议保留较高的误报率,以避免增加漏报率,强调人工安全分析师审查的必要性。
  • 模块化设计允许对不同LOLBin(如regsvr32和rundll32)独立更新检测规则,而不影响其他组件。
  • 自定义标记化规则(包括$<$url$>$、$<$ext_*$>$、$<$guid$>$和$<$mal_keyword$>$)可实现在多种二进制文件与命令结构间的一致性模式识别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。