Skip to main content
QUICK REVIEW

[论文解读] MLPdf: An Effective Machine Learning Based Approach for PDF Malware Detection

Jason Zhang|arXiv (Cornell University)|Aug 21, 2018
Advanced Malware Detection Techniques参考文献 5被引用 20
一句话总结

本文提出 MLPdf,一种基于多层感知机(MLP)的神经网络模型,通过从约105,000份真实世界PDF文件中提取的48个高质量特征,检测基于PDF的恶意软件。该模型实现了95.12%的真正例率,且仅0.08%的假正例率,显著优于八款商用杀毒扫描器。

ABSTRACT

Due to the popularity of portable document format (PDF) and increasing number of vulnerabilities in major PDF viewer applications, malware writers continue to use it to deliver malware via web downloads, email attachments and other methods in both targeted and non-targeted attacks. The topic on how to effectively block malicious PDF documents has received huge research interests in both cyber security industry and academia with no sign of slowing down. In this paper, we propose a novel approach based on a multilayer perceptron (MLP) neural network model, termed MLPdf, for the detection of PDF based malware. More specifically, the MLPdf model uses a backpropagation algorithm with stochastic gradient decent search for model update. A group of high quality features are extracted from two real-world datasets which comprise around 105000 benign and malicious PDF documents. Evaluation results indicate that the proposed MLPdf approach exhibits excellent performance which significantly outperforms all evaluated eight well known commercial anti-virus scanners with a much higher true positive rate of 95.12% achieved while maintaining a very low false positive rate of 0.08%.

研究动机与目标

  • 为应对通过社会工程学和零日漏洞利用在广泛使用的PDF阅读器中传播PDF恶意软件的日益增长的威胁。
  • 克服传统基于签名和沙箱的检测方法在混淆、多态性及零日攻击面前表现不佳的局限性。
  • 开发一种机器学习模型,能够在保持极低假正例率的同时,实现高真正例率的恶意PDF检测。
  • 在真实世界条件下,评估该模型相较于最先进商用杀毒扫描器的性能表现。

提出的方法

  • MLPdf模型采用包含两层各72个神经元的隐藏层以及单个S型输出层的多层感知机,用于二分类(恶意/良性)。
  • 模型训练采用随机梯度下降法进行反向传播,并设置0.15的丢弃率以防止训练过程中的过拟合。
  • 在每一层应用批量归一化,通过保持层输入的零均值和单位方差,稳定并加速训练过程。
  • 使用占训练数据20%的验证集来监控过拟合现象,并指导超参数选择。
  • 在包含约105,000份良性与恶意PDF的训练数据集上,以64的批量大小训练5,000个周期。
  • 选择0.62的概率阈值以平衡检测性能,从而获得最优的真正例率与假正例率。

实验结果

研究问题

  • RQ1基于多层感知机的机器学习模型能否在准确率上显著优于商用杀毒扫描器,有效检测恶意PDF?
  • RQ2在检测经过混淆或零日攻击的PDF恶意软件时,MLPdf模型在真正例率与假正例率方面表现如何?
  • RQ3与启发式或基于签名的方法相比,高质量、人工选取的特征在多大程度上提升了检测性能?
  • RQ4在MLP架构中使用丢弃和批量归一化,是否能提升模型在未见PDF样本上的泛化能力与鲁棒性?

主要发现

  • 在包含13,101份良性文件与1,946份恶意文件的测试集中,MLPdf模型实现了95.12%的真正例率,显著优于表现最佳的商用杀毒扫描器(仅84.53%)。
  • 模型维持了极低的假正例率0.08%,相当于在13,101份良性文件中仅产生10.4次假正例。
  • 当假正例率控制在0.1%时,模型仍能达到95%的真正例率,表明其在中等假正例率约束下表现强劲。
  • 模型在不同概率阈值下性能稳定,真正例率与假正例率之间存在清晰的权衡关系。
  • 如图6所示,MLPdf在所有测试阈值下均显著优于所评估的八款商用杀毒扫描器。
  • 48个高质量特征的使用,结合批量归一化与丢弃技术,显著提升了模型的泛化能力并降低了过拟合风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。