[论文解读] A Deep Learning Model with Hierarchical LSTMs and Supervised Attention for Anti-Phishing
本文提出一种基于监督注意力机制的分层LSTM模型,用于反钓鱼邮件检测,通过利用词级和句级表征提升分类性能。该模型在IWSPA-AP 2018共享任务的未见测试数据上达到最先进性能,无邮件头时F1得分为0.979,有邮件头时F1得分为0.991。
Anti-phishing aims to detect phishing content/documents in a pool of textual data. This is an important problem in cybersecurity that can help to guard users from fraudulent information. Natural language processing (NLP) offers a natural solution for this problem as it is capable of analyzing the textual content to perform intelligent recognition. In this work, we investigate state-of-the-art techniques for text categorization in NLP to address the problem of anti-phishing for emails (i.e, predicting if an email is phishing or not). These techniques are based on deep learning models that have attracted much attention from the community recently. In particular, we present a framework with hierarchical long short-term memory networks (H-LSTMs) and attention mechanisms to model the emails simultaneously at the word and the sentence level. Our expectation is to produce an effective model for anti-phishing and demonstrate the effectiveness of deep learning for problems in cybersecurity.
研究动机与目标
- 解决传统钓鱼邮件检测方法严重依赖人工特征工程的局限性。
- 开发一种端到端的深度学习模型,能够从原始邮件文本中自动学习有效表征。
- 通过在词级和句级对邮件结构进行分层建模,提升钓鱼邮件检测性能。
- 通过一种基于词频排序的新型监督注意力机制,增强模型的可解释性与性能。
- 在IWSPA-AP 2018共享任务提供的真实世界不平衡钓鱼邮件数据集上评估模型。
提出的方法
- 该模型采用分层LSTM架构,其中词级LSTM处理句子中的单个词,句级LSTM将句子表征聚合为完整邮件的表征。
- 在词级和句级均应用注意力机制,动态加权邮件中不同词和句子的重要性。
- 提出一种新型监督注意力技术,其中词级注意力由训练语料库中词的逆频次排名引导,以优先关注罕见且可能可疑的术语。
- 集成一个独立的邮件头网络,使用注意力LSTM建模邮件头特征(当可用时),以提升检测准确率。
- 模型通过交叉熵损失进行端到端训练,并使用时间反向传播进行优化。
- 对于含邮件头的数据,将完整邮件头集的训练数据与同一集合中提取的邮件正文章节结合,构建更大、更鲁棒的训练分布。
实验结果
研究问题
- RQ1具有注意力机制的分层深度学习模型是否能在钓鱼邮件检测中超越传统机器学习方法?
- RQ2通过专用邮件头网络将邮件头整合到分类流程中,其有效性如何?
- RQ3基于词频排序的监督注意力在多大程度上提升了模型性能与可解释性?
- RQ4在词级与句级对邮件进行分层建模,是否相比平坦模型能带来更好的表征学习效果?
- RQ5与平衡的公开基准相比,该模型在不平衡的真实世界钓鱼邮件数据集上的泛化能力如何?
主要发现
- 所提出的H-LSTM结合监督注意力模型在首个共享任务(无邮件头)中取得0.979的F1得分,位居所有参赛系统第一。
- 在第二个共享任务(有邮件头)中,模型取得0.991的F1得分,整体排名第二,表明其在真实世界数据上表现强劲。
- 在交叉验证中,引入邮件头网络使F1得分从0.9631提升至0.9705,性能相对提升0.7%。
- 在同时来自无邮件头和完整邮件头数据集的组合数据上进行训练的模型,优于仅在单一数据集上训练的模型,显示出更强的泛化能力。
- 基于词频排序的监督注意力机制显著增强了模型对罕见可疑术语的关注,有助于提升检测效果。
- 完整模型(H-LSTM + 邮件头 + 监督注意力)的训练时间为1.5小时,测试数据推理仅需1分钟,表明其具备实际可部署性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。