Skip to main content
QUICK REVIEW

[论文解读] Deep Learning Algorithm for Threat Detection in Hackers Forum (Deep Web)

Victor Adewopo, Bilal Gonen|arXiv (Cornell University)|Feb 3, 2022
Network Security and Intrusion Detection被引用 11
一句话总结

本文提出一种基于长短期记忆(LSTM)的深度学习模型,通过分析基于匿名化TOR网络的深网黑客论坛中的文本内容,检测网络威胁。该模型在识别损毁指标和漏洞暴露方面实现了94%的准确率和90%的精确率,优于SVM和随机森林等现有方法,在威胁预测任务中表现更优。

ABSTRACT

In our current society, the inter-connectivity of devices provides easy access for netizens to utilize cyberspace technology for illegal activities. The deep web platform is a consummative ecosystem shielded by boundaries of trust, information sharing, trade-off, and review systems. Domain knowledge is shared among experts in hacker's forums which contain indicators of compromise that can be explored for cyberthreat intelligence. Developing tools that can be deployed for threat detection is integral in securing digital communication in cyberspace. In this paper, we addressed the use of TOR relay nodes for anonymizing communications in deep web forums. We propose a novel approach for detecting cyberthreats using a deep learning algorithm Long Short-Term Memory (LSTM). The developed model outperformed the experimental results of other researchers in this problem domain with an accuracy of 94\% and precision of 90\%. Our model can be easily deployed by organizations in securing digital communications and detection of vulnerability exposure before cyberattack.

研究动机与目标

  • 为应对源自深网黑客论坛的日益增长的网络威胁挑战,这些论坛充斥着非法讨论和损毁指标。
  • 开发一种自动化、可部署的系统,以在攻击发生前检测新兴网络威胁和漏洞暴露。
  • 通过利用LSTM进行序列建模,改进现有机器学习模型,以在基于自然语言的威胁检测中实现更优性能。
  • 使执法机构和网络安全团队能够利用匿名化深网社区的情报,主动识别并响应网络威胁。
  • 为未来在安全深网数据爬取和地理空间威胁画像方面的研究奠定基础。

提出的方法

  • 采用命名实体识别(NER)从论坛帖子中提取与网络威胁相关的实体,如恶意软件名称、攻击向量和系统漏洞。
  • 采用分词和序列填充技术,将原始文本转换为适合深度学习输入的固定长度数值矩阵。
  • 设计一种长短期记忆(LSTM)神经网络架构,以对论坛讨论中的序列依赖关系进行建模,实现威胁分类。
  • 使用包含匿名化深网论坛文本的数据集,经过十二个周期训练LSTM模型,输入序列长度限制在250个词以内。
  • 应用标准自然语言处理预处理技术,包括词嵌入和序列填充,以保持输入长度一致,确保模型稳定性。
  • 使用标准指标(准确率、精确率、召回率和F1分数)在训练集和验证集上评估模型性能。

实验结果

研究问题

  • RQ1深度学习模型能否有效检测来自深网黑客论坛的非结构化文本中的网络威胁?
  • RQ2与SVM和随机森林等传统机器学习模型相比,基于LSTM的方法在分类网络威胁内容方面表现如何?
  • RQ3NER和序列建模在论坛讨论中识别损毁指标方面的改进程度如何?
  • RQ4该模型能否泛化以检测来自动态深网内容的已知和新兴威胁?
  • RQ5此类模型在现实世界网络安全运营中部署以实现主动威胁情报的潜力如何?

主要发现

  • 所提出的LSTM模型在检测深网论坛文本中的网络威胁方面实现了94%的准确率、90%的精确率和91%的召回率,显著优于基线模型。
  • 与Dong等人提出的SVM模型(81%准确率)相比,LSTM模型在整体准确率上提高了13个百分点。
  • 在整体威胁检测方面,该模型优于Azene等人提出的随机森林分类器(系统漏洞检测准确率为97%),在各项指标间表现出更优的平衡性。
  • 该模型实现了90%的精确率,表明其在识别真实威胁方面具有高度可靠性,且误报率较低。
  • 结果证实,使用LSTM进行序列建模在分析深网论坛中长篇幅、上下文丰富的网络威胁讨论方面极为有效。
  • 本研究证明了在匿名化深网数据上应用深度学习进行主动网络威胁情报收集的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。