[论文解读] FLOCK: Combating Astroturfing on Livestreaming Platforms
FLOCK 是一种无监督、可扩展的方法,通过建模广播行为来检测直播平台上的虚假观看(视bots),识别出同步的异常观看行为。即使在对抗性条件下,该方法在检测被bot操控的直播流时精度超过98%,在识别单个bot观看行为时精度和召回率均超过90%。
Livestreaming platforms have become increasingly popular in recent years as a means of sharing and advertising creative content. Popular content streamers who attract large viewership to their live broadcasts can earn a living by means of ad revenue, donations and channel subscriptions. Unfortunately, this incentivized popularity has simultaneously resulted in incentive for fraudsters to provide services to astroturf, or artificially inflate viewership metrics by providing fake "live" views to customers. Our work provides a number of major contributions: (a) formulation: we are the first to introduce and characterize the viewbot fraud problem in livestreaming platforms, (b) methodology: we propose FLOCK, a principled and unsupervised method which efficiently and effectively identifies botted broadcasts and their constituent botted views, and (c) practicality: our approach achieves over 98% precision in identifying botted broadcasts and over 90% precision/recall against sizable synthetically generated viewbot attacks on a real-world livestreaming workload of over 16 million views and 92 thousand broadcasts. FLOCK successfully operates on larger datasets in practice and is regularly used at a large, undisclosed livestreaming corporation.
研究动机与目标
- 正式定义并描述直播平台中视bots欺诈问题,即利用虚假观看人为夸大受欢迎度指标。
- 开发一种可扩展的无监督方法,无需依赖真实标签即可检测被bot操控的直播流及单个bot观看行为。
- 解决检测具有可变时间安排和IP控制的视bots的挑战,此类视bots可规避传统密集子图或有监督检测方法。
- 评估该方法在对抗性环境下的鲁棒性,即攻击者通过从经验区间分布中采样来模仿真实观看行为时的表现。
- 在包含1600万次观看和92,000场直播的真实数据集上展示其实际有效性,证明其具备高精度和可扩展性。
提出的方法
- FLOCK 将每场直播视为一系列观看事件的集合,以时间起点和持续时间比例表示,用于检测异常行为模式。
- 通过视观看数偏离图识别出与预期观看行为显著偏离的直播,将其标记为可能被bot操控的直播。
- 对被标记的直播,FLOCK 应用X-means聚类算法,根据时间同步性对观看行为进行分组,识别出体现bot活动的同步行为。
- 应用一种剪枝启发式方法(PRUNE-ITERATIVE),通过迭代方式移除表现出同步行为的观看记录,从而精炼疑似bot观看的集合。
- 该方法利用广播时长和观看行为的经验分布来建模‘正常’行为,从而在无需标注数据的情况下检测偏离行为。
- 通过模拟一个攻击者从真实区间分布中采样以最小化偏离度的场景,评估其对抗鲁棒性,结果表明此类攻击的IP成本显著上升。
实验结果
研究问题
- RQ1如何对直播平台上的虚假观看行为(视bots)进行形式化定义和描述,并与真实观看行为区分开来?
- RQ2何种无监督、可扩展的方法能有效检测被bot操控的直播流及单个bot观看行为,且无需依赖标注数据?
- RQ3当攻击者通过从经验分布中采样来模仿真实观看行为时,FLOCK 在此类对抗性条件下的表现如何?
- RQ4在使用FLOCK检测机制的情况下,视bots的实际成本(特别是所需IP地址数量)是多少?
- RQ5FLOCK 在包含数百万次观看和数千场直播的大规模真实数据集上如何实现可扩展性?
主要发现
- 在包含1600万次观看和92,000场直播的真实数据集中,FLOCK 在识别被bot操控的直播流时精度超过98%。
- 在大规模合成视bots攻击中,FLOCK 对单个bot观看行为的检测精度和召回率均超过90%。
- 即使攻击者从真实区间分布中采样以模仿正常行为,FLOCK 仍使视bots所需的IP数量相比简单速率限制增加40%。
- FLOCK 的性能随观看次数线性扩展,展现出在大规模工业工作负载中的优异表现。
- 该方法成功识别出同步观看行为的模式,例如贯穿整个直播时长的观看行为,这类特征是bot活动的典型标志。
- FLOCK 的结果可用于标记欺诈性主播、惩罚可疑IP地址,并通过提取的特征签名支持有监督学习系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。