Skip to main content
QUICK REVIEW

[论文解读] Botnet Campaign Detection on Twitter

Jeremy Fields|arXiv (Cornell University)|Aug 29, 2018
Spam and Phishing Detection参考文献 2被引用 4
一句话总结

本文提出了一种实时、轻量级的方法,通过分析相邻推文之间的时序相似性和属性一致性,检测Twitter上的僵尸网络活动,从920,008条推文中成功识别出14,585个僵尸账号,具有高速度和低计算成本,相较于传统机器学习和网络分析方法,在及时性和可扩展性方面表现更优,尤其适用于协调性垃圾信息活动的检测。

ABSTRACT

This is an approach to detecting a subset of bots on Twitter, that at best is under-researched. This approach will be generic enough to be adaptable to most, if not all social networks. The subset of bots this focuses on are those that can evade most, if not all current detection methods. This is simply because they have little to no information associated with them that can be analyzed to make a determination. Although any account on any social media site inherently has information associated with it, it is very easy to blend in with the majority of users who are simply "lurkers" - those who only consume content, but do not contribute. How can you determine if an account is a bot if they don't do anything? By the time they act, it will be too late to detect. The only solution would be a real time, or near real-time, detection algorithm.

研究动机与目标

  • 解决传统检测方法难以发现僵尸网络活动的问题,这些活动通常通过保持静默或模仿人类‘旁观者’行为来规避检测。
  • 开发一种无需依赖历史数据、网络分析或复杂机器学习模型的实时检测系统。
  • 通过比较某条推文与其最近N条时间顺序相邻推文的属性,识别僵尸网络,重点关注行为和文本的一致性。
  • 实现可扩展、低计算成本的检测方法,适用于高吞吐量社交媒体数据流的部署。
  • 提供一种在僵尸网络实际发动攻击前即可检测的方法,克服传统反应式检测策略的延迟问题。

提出的方法

  • 该方法通过在时间顺序上将每条推文的属性与最近的N条相邻推文进行比较,使用N条推文的滑动窗口进行实时分析。
  • 对12项属性(包括文本相似度、语言、用户代理、位置、个人资料URL和情感)分别计算0到N的得分,每项属性独立评分。
  • 综合所有属性的得分,对非布尔型属性应用阈值(例如,文本相似度阈值设为0.6)。
  • 根据综合得分是否超过最大可能得分的预设百分比,对僵尸账号进行分类。
  • 该方法避免依赖账户历史记录、网络结构或复杂模型,仅关注局部时间一致性。
  • 采用可配置的评分系统,包含乘数和阈值,可灵活适配不同数据源和检测目标。

实验结果

研究问题

  • RQ1是否可以使用一种轻量级、实时的方法,在不依赖历史数据或网络分析的前提下,检测Twitter上的协调性僵尸网络活动?
  • RQ2相邻推文之间的时间属性一致性在识别僵尸网络活动方面有多有效?
  • RQ3基于简单比较的系统是否能在检测隐蔽性高、活动频率低的僵尸网络方面超越复杂的机器学习模型?
  • RQ4哪些属性相似度的阈值和乘数配置能为僵尸网络活动检测提供最佳准确率?
  • RQ5该方法在高吞吐量数据流(如Twitter的Firehose)上的可扩展性如何?

主要发现

  • 该方法从920,008条推文中检测出14,585个僵尸账号,其中10,998个为独立账号,表明检测覆盖范围广泛。
  • 在检测出的2,586个僵尸账号中,全部被Twitter平台封禁或删除,验证了系统的准确性和现实相关性。
  • 系统处理数据的速度是数据采集速度的五倍以上,仅用5小时45分钟就处理完920,008条推文。
  • 当滑动窗口中20条推文中有17条显示高文本相似度(得分 > 0.6)时,是僵尸活动的强烈指标,表明存在协调性信息传播。
  • 即使位置和时区数据不一致或缺失,该方法仍能通过一致的个人资料URL、描述和用户代理识别出僵尸网络。
  • 该方法在极低计算成本下实现高性能,仅使用单台消费级计算机上的Python实现,通过优化或分布式处理可进一步提升扩展能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。