Skip to main content
QUICK REVIEW

[论文解读] PDF-Malware: An Overview on Threats, Detection and Evasion Attacks

N. Fleury, Theo Dubrunquez|arXiv (Cornell University)|Jul 27, 2021
Advanced Malware Detection Techniques参考文献 30被引用 10
一句话总结

本文全面概述了PDF恶意软件威胁、检测技术(尤其是基于机器学习的方法)以及新兴的规避攻击挑战。研究结果表明,通过向恶意PDF中添加非功能性对象,可实现超过98%的成功率来绕过最先进的分类器,凸显了结合静态分析、动态分析和硬件特征的鲁棒性混合检测模型在提升对抗性操纵抵御能力方面的重要性。

ABSTRACT

In the recent years, Portable Document Format, commonly known as PDF, has become a democratized standard for document exchange and dissemination. This trend has been due to its characteristics such as its flexibility and portability across platforms. The widespread use of PDF has installed a false impression of inherent safety among benign users. However, the characteristics of PDF motivated hackers to exploit various types of vulnerabilities, overcome security safeguards, thereby making the PDF format one of the most efficient malicious code attack vectors. Therefore, efficiently detecting malicious PDF files is crucial for information security. Several analysis techniques has been proposed in the literature, be it static or dynamic, to extract the main features that allow the discrimination of malware files from benign ones. Since classical analysis techniques may be limited in case of zero-days, machine-learning based techniques have emerged recently as an automatic PDF-malware detection method that is able to generalize from a set of training samples. These techniques are themselves facing the challenge of evasion attacks where a malicious PDF is transformed to look benign. In this work, we give an overview on the PDF-malware detection problem. We give a perspective on the new challenges and emerging solutions.

研究动机与目标

  • 分析由于PDF格式被认为安全且广泛使用,导致PDF恶意软件威胁日益增长的原因。
  • 综述现有的检测技术,包括静态分析、动态分析以及基于机器学习的方法。
  • 研究基于机器学习的PDF恶意软件检测器在规避攻击下的脆弱性。
  • 提出针对规避攻击的防御措施,如对抗性训练和特征强化,并探讨混合检测模型。
  • 从研究视角出发,探讨如何提升检测器对不断演变的对抗性PDF的鲁棒性。

提出的方法

  • 通过PDFiD进行静态分析,提取对象数量、交叉引用表大小和流内容等特征,用于训练分类器。
  • 在包含20,000个样本(10,000个良性,10,000个恶意)的数据集上训练支持向量机(SVM),准确率达到99.60%,误报率为0.05%。
  • 通过在恶意PDF中注入空对象,实施白盒规避攻击,以增加特征值(如对象数量),同时不改变文件的视觉或行为输出。
  • 采用基于梯度下降的对抗性攻击,以分析方式最小化使可微分类器(如SVM和神经网络)失效所需的噪声。
  • 提出应对措施,包括特征阈值化、鲁棒特征选择,以及使用规避样本进行对抗性训练。
  • 探索通过结合静态分析、动态分析和硬件特征实现混合检测,以增强对规避攻击的鲁棒性。

实验结果

研究问题

  • RQ1基于机器学习的分类器在使用静态特征检测恶意PDF方面效果如何?
  • RQ2通过修改文件中非功能性元素,规避攻击在多大程度上可以绕过训练好的PDF恶意软件检测器?
  • RQ3当前基于机器学习的检测系统中,哪些关键漏洞使得通过特征操纵实现规避成为可能?
  • RQ4对抗性训练和特征强化如何提升PDF恶意软件检测器的鲁棒性?
  • RQ5混合检测模型(静态、动态、硬件)在缓解规避攻击方面发挥什么作用?

主要发现

  • 基于机器学习的PDF恶意软件检测器在使用SVM对10,000个良性和10,000个恶意PDF组成的平衡数据集进行训练后,准确率达到99.60%,误报率为0.05%。
  • 一种通过向恶意PDF中注入空对象的规避攻击,成功实现了98%的绕过率,且未改变文件的行为或外观。
  • 基于梯度下降的对抗性攻击在生成最小扰动以欺骗可微分类器方面非常有效,表明在特征空间中具有高度的操控自由度。
  • 对对象数量或流大小等特征进行阈值化处理,可有效阻止依赖特征膨胀的简单规避攻击。
  • 对抗性训练——即使用规避样本重新训练分类器——被识别为一种可行的防御机制,可提升检测器的鲁棒性。
  • 结合静态分析、动态分析和硬件特征是提升检测鲁棒性、降低对规避攻击敏感性的有前景方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。