[论文解读] Generative Models for Spear Phishing Posts on Social Media
本文提出了一种基于LSTM的生成模型,通过利用目标特定的社交媒体内容,自动化生成个性化网络钓鱼攻击,从而在社交媒体上创建具有高点击率的逼真消息。该系统通过动态地从目标的时间线中提取话题并选择在活跃高峰时段发布,实现了30–66%的点击率——是传统电子邮件钓鱼攻击成功率的三倍以上。
Historically, machine learning in computer security has prioritized defense: think intrusion detection systems, malware classification, and botnet traffic identification. Offense can benefit from data just as well. Social networks, with their access to extensive personal data, bot-friendly APIs, colloquial syntax, and prevalence of shortened links, are the perfect venues for spreading machine-generated malicious content. We aim to discover what capabilities an adversary might utilize in such a domain. We present a long short-term memory (LSTM) neural network that learns to socially engineer specific users into clicking on deceptive URLs. The model is trained with word vector representations of social media posts, and in order to make a click-through more likely, it is dynamically seeded with topics extracted from the target's timeline. We augment the model with clustering to triage high value targets based on their level of social engagement, and measure success of the LSTM's phishing expedition using click-rates of IP-tracked links. We achieve state of the art success rates, tripling those of historic email attack campaigns, and outperform humans manually performing the same task.
研究动机与目标
- 研究机器学习在网络攻击中如何被用于进攻性目的,特别是自动化个性化社交媒体网络钓鱼攻击。
- 解决现有自动化社交工程工具在利用目标公开的社交媒体数据为其量身定制消息方面存在的空白。
- 通过结合大规模攻击的可扩展性与针对性网络钓鱼的精准性,提升传统网络钓鱼活动的低成功率问题。
- 评估机器生成的网络钓鱼内容在真实社交媒体环境中的有效性,与人工操作的网络钓鱼活动进行对比。
- 证明社交媒体的非正式语言、短链接以及公开数据,使其成为自动化、高影响力攻击的理想温床。
提出的方法
- 在社交媒体帖子的词向量表示上训练长短期记忆(LSTM)神经网络,以生成个性化的网络钓鱼消息。
- 通过从目标社交媒体时间线中提取的话题动态地为LSTM提供种子输入,以提高消息的相关性与真实感。
- 使用KMeans聚类(k=3)根据参与度指标、粉丝互动情况及资料设置对用户进行筛选,识别高价值目标。
- 通过分析目标历史发帖时间分布的直方图,确定其在线活跃高峰时段,并在该时段安排网络钓鱼内容发布。
- 使用带有目标用户名作为参数的模拟网络钓鱼链接(例如:https://www.google.com/?screen_name=[TARGET]),通过IP追踪链接来监控点击行为。
- 使用一个具有伪造但逼真资料数据和真实互动记录的社交媒体账号,以增强可信度并避免被检测。
实验结果
研究问题
- RQ1机器学习能否生成具有显著高于传统网络钓鱼活动点击率的社交工程型社交媒体帖子?
- RQ2利用目标特定的社交媒体内容进行个性化处理,在多大程度上能提升社交媒体网络钓鱼攻击的成功率?
- RQ3在吞吐量与点击率方面,自动化机器学习系统与人工执行相同网络钓鱼任务相比,表现如何?
- RQ4在目标活跃高峰时段进行发帖调度,在多大程度上提升了自动化网络钓鱼消息的有效性?
- RQ5社交媒体平台特征(如非正式语言、短链接、公开数据暴露)在多大程度上影响了自动化网络钓鱼的可行性与成功率?
主要发现
- 该自动化系统实现了30%至66%的点击率,显著高于历史电子邮件网络钓鱼活动的5%–14%成功率。
- 系统每分钟可生成6.85条帖子,而人工操作者仅为1.075条/分钟,展现出显著的效率优势。
- 在两小时内,系统最多可实现275次点击,而人工对手仅实现49次,凸显其在可扩展性与有效性方面的优势。
- 在高峰时段安排发帖是关键因素——移除该功能后点击率急剧下降,表明发布时间是成功的关键。
- 30%的点击来自t.co来源,表明存在真实人类互动;另有36%的点击来自极不可能由机器人驱动的国家,进一步证实了互动的真实性。
- 与人工生成的消息相比,该模型生成的消息在相同任务中表现更优,证明了数据驱动、个性化自动化在社交工程中的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。