[论文解读] ITect: Scalable Information Theoretic Similarity for Malware Detection
ITect 是一种可扩展的信息论恶意软件检测系统,通过字节 n-gram 上的基于熵的模式(EnTS)和统计语言模型(SLaMM),在混合恶意软件数据集上实现了 100% 的精确率和 90.3% 的准确率,优于所有 56 个 VirusTotal 杀毒引擎的精确率和准确率,且在无需动态分析或逆向工程的情况下实现线性时间运行。
Malware creators have been getting their way for too long now. String-based similarity measures can leverage ground truth in a scalable way and can operate at a level of abstraction that is difficult to combat from the code level. We introduce ITect, a scalable approach to malware similarity detection based on information theory. ITect targets file entropy patterns in different ways to achieve 100% precision with 90% accuracy but it could target 100% recall instead. It outperforms VirusTotal for precision and accuracy on combined Kaggle and VirusShare malware.
研究动机与目标
- 解决多态和自变种恶意软件数量和复杂性日益增长所带来的可扩展性和规避挑战。
- 开发一种无需动态分析、逆向工程或人工干预的检测方法,以降低费用并提高自动化水平。
- 利用原始字节字符串上的信息论相似性,在高层次抽象上检测恶意软件,使攻击者难以规避。
- 在桌面恶意软件分析中实现高精确率和高准确率,尤其适用于对误报不可接受的场景。
- 在真实世界数据集上,对各类恶意软件(包括加壳、自变种和多态变种)展示出稳健的性能。
提出的方法
- 使用 EnTS 提取文件熵的幅度和纵向变化中的简化签名,将其作为机器学习特征。
- 在恶意软件(M)和良性软件(B)库上构建 n-gram 语言模型,以捕捉字节级模式中的统计规律。
- 应用三种信息论度量——交叉熵、Kullback-Leibler 散度和均方误差——将可疑文件的 n-gram 分布与 M 和 B 模型进行比较。
- 仅当基于 M 和 B 模型的三个子分类器全部一致同意时,才将文件分类为恶意软件,以确保高精确率。
- 通过直接在原始字节字符串上操作,无需预处理、动态执行或静态分析,实现分类的线性时间复杂度。
- 将 EnTS 和 SLaMM 作为互补检测器集成:EnTS 通过熵模式检测多态恶意软件,而 SLaMM 通过统计语言建模检测自变种和加壳恶意软件。
实验结果
研究问题
- RQ1在无需动态分析或逆向工程的情况下,基于原始字节字符串的信息论相似性度量能否以高精确率和高准确率检测恶意软件?
- RQ2熵模式和 n-gram 语言模型在多大程度上能够检测包括多态、自变种和加壳变种在内的多样化恶意软件家族?
- RQ3ITect 的性能与现有杀毒引擎相比如何,特别是在真实世界恶意软件数据集上的精确率和准确率方面?
- RQ4一种线性时间、执行无关的方法是否能在测试集中不同恶意软件比例下实现稳健的检测性能?
- RQ5基于良性软件和恶意软件库训练的统计语言模型,是否能通过信息论差异有效区分恶意软件和良性软件?
主要发现
- ITect 在包含 30,000 个恶意软件和 2,000 个良性文件的混合数据集上实现了 100% 的精确率和 90.3% 的准确率,优于所有 56 个 VirusTotal 杀毒引擎。
- 表现最佳的 VirusTotal 引擎实现了 99.4% 的精确率,但准确率仅为 71.4%,表明 ITect 在整体准确率上显著更优。
- 即使测试集中恶意软件比例从 50% 降至 0%,ITect 的精确率仍保持在 100%,而准确率持续提升。
- EnTS 和 SLaMM 组件均检测到了其设计目标以外的恶意软件类型——EnTS 因压缩/加密区域检测到自变种恶意软件,SLaMM 因良性模型中熵较低而检测到多态恶意软件。
- ITect 的时间复杂度与文件数量呈线性关系,使其可在大规模恶意软件分析流水线中实现可扩展部署。
- 该方法与执行环境无关,直接在原始字符串上运行,无需虚拟机、沙箱或逆向工程,从而降低了人力和计算开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。