Skip to main content
QUICK REVIEW

[论文解读] Detecting malicious PDF using CNN

Raphael Fettaya, Yishay Mansour|arXiv (Cornell University)|Jul 24, 2020
Advanced Malware Detection Techniques参考文献 16被引用 7
一句话总结

本文提出一种基于卷积神经网络(CNN)集成的深度学习方法,直接从原始字节级表示中检测恶意PDF文件,无需人工特征工程。该方法实现了94%的检测准确率,并能识别零日恶意软件,其性能优于许多商业杀毒解决方案,同时还能以高同质性和完整性将恶意软件聚类为家族。

ABSTRACT

Malicious PDF files represent one of the biggest threats to computer security. To detect them, significant research has been done using handwritten signatures or machine learning based on manual feature extraction. Those approaches are both time-consuming, require significant prior knowledge and the list of features has to be updated with each newly discovered vulnerability. In this work, we propose a novel algorithm that uses an ensemble of Convolutional Neural Network (CNN) on the byte level of the file, without any handcrafted features. We show, using a data set of 90000 files downloadable online, that our approach maintains a high detection rate (94%) of PDF malware and even detects new malicious files, still undetected by most antiviruses. Using automatically generated features from our CNN network, and applying a clustering algorithm, we also obtain high similarity between the antiviruses' labels and the resulting clusters.

研究动机与目标

  • 开发一种自动化的、无需特征工程的恶意PDF检测方法,基于深度学习。
  • 提升对传统基于签名的杀毒系统难以检测的零日及未知恶意软件变种的检测能力。
  • 利用CNN学习到的特征,自动将恶意PDF文件聚类为不同的家族。
  • 在真实世界数据集上,将模型性能与商业杀毒引擎进行对比评估。
  • 为未来PDF恶意软件检测研究建立一个公开基准数据集。

提出的方法

  • 模型将原始PDF文件作为字节值的2D张量进行处理,将每个文件视为图像输入至CNN。
  • 训练多个CNN架构的集成模型,以提高鲁棒性和检测准确率。
  • 网络直接从字节级表示中学习分层特征,无需人工特征提取。
  • 使用HDBSCAN聚类算法对CNN学习到的特征嵌入进行处理,无需预先标注即可将恶意软件聚类为家族。
  • 通过检测率、误报率以及聚类指标(同质性和完整性)评估模型性能。
  • 在来自VirusTotal的90,000个PDF文件数据集上验证该方法,包含良性与恶意样本。

实验结果

研究问题

  • RQ1在仅使用原始字节级数据进行训练的CNN模型,能否在无需人工特征工程的情况下以高准确率检测恶意PDF文件?
  • RQ2该模型能否检测出当时大多数商业杀毒引擎尚未识别的零日恶意软件?
  • RQ3CNN学习到的特征在多大程度上能将恶意PDF文件聚类为有意义且一致的家族?
  • RQ4该模型的聚类性能与多个杀毒厂商分配的标签相比如何?
  • RQ5即使杀毒厂商使用不同的命名规范,模型的内部表示能否揭示恶意软件家族之间的结构相似性?

主要发现

  • CNN集成模型在保持0.5%低误报率的同时,实现了94%的恶意PDF检测率。
  • 该模型成功检测出14.5%的恶意软件样本,这些样本在测试时未被大多数杀毒引擎识别,证明了其零日检测能力。
  • CNN学习到的特征聚类在10个聚类中实现了超过75%的同质性评分,表明与杀毒厂商家族标签高度一致。
  • 该模型在聚类完整性方面表现优异,75%的恶意软件样本被分入至少一个杀毒厂商所定义家族的聚类中。
  • 在相同测试集上,该模型的检测率优于大多数商业杀毒解决方案,尤其在未知或零日威胁检测方面表现更优。
  • 研究发现,不同杀毒厂商使用的命名规范不一致,部分厂商使用更具体的标签(如Microsoft),另一些则使用更通用的标签(如McAfee),而该模型的聚类有助于调和这些差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。