[论文解读] DeepBF: Malicious URL detection using Learned Bloom Filter and Evolutionary Deep Learning
该论文提出 deepBF,一种两阶段恶意 URL 检测系统,结合自适应 2D 布隆过滤器与进化卷积神经网络(evoCNN)。系统在 2D 布隆过滤器中使用改进的 Murmur2 哈希函数,以减少误报并加速过滤,同时 evoCNN 对先前未见过的 URL 进行分类;通过将常见 URL 交由快速过滤层处理,该系统在降低计算负载的同时实现了高准确率。
Malicious URL detection is an emerging research area due to continuous modernization of various systems, for instance, Edge Computing. In this article, we present a novel malicious URL detection technique, called deepBF (deep learning and Bloom Filter). deepBF is presented in two-fold. Firstly, we propose a learned Bloom Filter using 2-dimensional Bloom Filter. We experimentally decide the best non-cryptography string hash function. Then, we derive a modified non-cryptography string hash function from the selected hash function for deepBF by introducing biases in the hashing method and compared among the string hash functions. The modified string hash function is compared to other variants of diverse non-cryptography string hash functions. It is also compared with various filters, particularly, counting Bloom Filter, Kirsch extit{et al.}, and Cuckoo Filter using various use cases. The use cases unearth weakness and strength of the filters. Secondly, we propose a malicious URL detection mechanism using deepBF. We apply the evolutionary convolutional neural network to identify the malicious URLs. The evolutionary convolutional neural network is trained and tested with malicious URL datasets. The output is tested in deepBF for accuracy. We have achieved many conclusions from our experimental evaluation and results and are able to reach various conclusive decisions which are presented in the article.
研究动机与目标
- 为应对边缘计算和物联网等现代系统中恶意 URL 检测日益增长的挑战。
- 通过使用优化的布隆过滤器预过滤已知 URL,减轻深度学习模型的计算负担。
- 通过自适应 2D 结构和增强偏差的非密码学哈希函数,提升布隆过滤器的准确率与效率。
- 评估 deepBF 相较于现有过滤器(如 Cuckoo、计数布隆、Kirsch)的性能,并证明其在误报率和内存效率方面的优越性。
- 使用真实恶意 URL 数据集验证端到端系统,表明混合方法在最小化模型推理负载的同时保持了高检测准确率。
提出的方法
- 设计使用质数维度(m ≠ n)的 2D 布隆过滤器,以改善哈希分布并减少冲突。
- 通过与 MMurmur 和 SHA512 等替代方案的实验对比,选择并改进 Murmur2 哈希函数作为最优的非密码学字符串哈希函数。
- 在哈希函数中引入有意的偏差和冗余,以提升性能而不增加误报概率(FPP),该结果已通过实验验证。
- 实现两层过滤机制:首先查询恶意(μBF)和良性(βBF)2D 布隆过滤器;若两者均返回假,则将 URL 传递给 evoCNN 进行分类。
- 在公开的恶意 URL 数据集(Mamun 数据集)上训练并测试一个进化卷积神经网络(evoCNN),以对新 URL 进行分类。
- 将 evoCNN 的输出集成到系统中:将确认的恶意 URL 插入 μBF,良性 URL 插入 βBF,使系统能够随时间学习并自适应调整。

实验结果
研究问题
- RQ1自适应 2D 布隆过滤器结合改进的非密码学哈希函数,是否在误报概率和内存效率方面优于传统及先进布隆过滤器变体?
- RQ2在哈希函数中引入有意偏差和冗余,是否会因降低密码学强度而增加布隆过滤器的误报率?
- RQ3两层过滤架构(布隆过滤器 + evoCNN)在减轻深度学习模型负载的同时,是否能保持高检测准确率?
- RQ4在多种真实场景测试中,deepBF 相较于 Cuckoo Filter、计数布隆过滤器和 Kirsch 等成熟过滤器的性能表现如何?
- RQ5通过重复插入操作学习的布隆过滤器行为,能在多大程度上在不重新训练 evoCNN 的前提下提升长期检测准确率?
主要发现
- 尽管引入了更高的偏差和冗余,改进后的 Murmur2 哈希函数在误报概率(FPP)和速度方面仍优于其他非密码学哈希函数,包括 MMurmur 和 SHA512。
- 基于密码学的哈希函数(如 SHA512)在布隆过滤器中并不必要,因其计算成本高且对 FPP 改进不显著,这与普遍假设相悖。
- deepBF 的误报概率低于 Cuckoo Filter(CF),后者在大键值尺寸或重复运行时表现出不可预测的 FPP 和内存膨胀。
- 在相同内存约束下,计数布隆过滤器(CBF)的内存占用更高且 FPP 更差,尽管其支持删除操作。
- 两层架构显著降低了 evoCNN 的负载:仅将新出现的、未见过的 URL 传递给深度学习模型,从而提升了系统效率。
- deepBF 在多次运行中表现出稳定性能,而 CF 因哈希种子不佳和设计缺陷,在重复执行时表现出不一致行为,甚至可能出现崩溃。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。