[论文解读] WebGraph: Capturing Advertising and Tracking Information Flows for Robust Blocking
WebGraph 通过建模信息流(如标识符存储和跨实体共享)而非依赖 URL 或代码等内容特征,提出了一种基于图的机器学习方法来检测广告和追踪器。这种转变使 WebGraph 对对抗性规避攻击的鲁棒性显著增强,将规避成功率从 AdGraph 的 96% 降低至 WebGraph 的 8%,同时保持了相当的检测准确率。
Millions of web users directly depend on ad and tracker blocking tools to protect their privacy. However, existing ad and tracker blockers fall short because of their reliance on trivially susceptible advertising and tracking content. In this paper, we first demonstrate that the state-of-the-art machine learning based ad and tracker blockers, such as AdGraph, are susceptible to adversarial evasions deployed in real-world. Second, we introduce WebGraph, the first graph-based machine learning blocker that detects ads and trackers based on their action rather than their content. By building features around the actions that are fundamental to advertising and tracking - storing an identifier in the browser, or sharing an identifier with another tracker - WebGraph performs nearly as well as prior approaches, but is significantly more robust to adversarial evasions. In particular, we show that WebGraph achieves comparable accuracy to AdGraph, while significantly decreasing the success rate of an adversary from near-perfect under AdGraph to around 8% under WebGraph. Finally, we show that WebGraph remains robust to a more sophisticated adversary that uses evasion techniques beyond those currently deployed on the web.
研究动机与目标
- 解决现有基于机器学习的广告和追踪器拦截工具因依赖易被操纵的内容特征而易受对抗性规避攻击的问题。
- 开发一种聚焦于广告和追踪服务基本行为(如存储或共享用户标识符)的检测系统。
- 提升对现实世界规避技术(如 URL 混淆和 CNAME 伪装)的鲁棒性。
- 评估所提方法在面对复杂且现实的规避策略时的韧性。
- 证明通过信息流特征实现的行为驱动检测是基于内容检测的可行且更安全的替代方案。
提出的方法
- 通过监控网络请求、JavaScript 执行、DOM 创建和浏览器存储访问,构建网页执行的跨层图。
- 提取显式建模标识符从追踪器到浏览器存储及其他第三方实体传播的流特征。
- 利用浏览器 API 代码注入技术检测存储或检索标识符(如 Cookie、localStorage)的调用,作为追踪行为的信号。
- 构建图表示,其中节点代表资源和浏览器 API,边代表它们之间的信息流。
- 在这些基于流的特征上训练机器学习分类器,完全替代对 URL 或代码模式等基于内容特征的依赖。
- 采用贪心图变异算法模拟对抗性规避,评估在现实攻击场景下的鲁棒性。
实验结果
研究问题
- RQ1能否使用现实世界的技术(如 URL 混淆和 CNAME 伪装)成功规避最先进的基于机器学习的广告和追踪器拦截工具?
- RQ2依赖内容特征在多大程度上使广告和追踪器检测系统易受对抗性操纵?
- RQ3从浏览器 API 交互中提取的信息流特征能否提供比基于内容的检测更鲁棒的替代方案?
- RQ4当攻击者使用复杂且现实的图变异技术时,WebGraph 在抵抗规避方面的有效性如何?
- RQ5尝试绕过 WebGraph 时,规避成功率与可用性损失之间的权衡是什么?
主要发现
- 当使用现实世界的规避技术(如 URL 混淆和 CNAME 伪装)时,WebGraph 将对抗性规避成功率从 AdGraph 的 96% 降低至仅 8%。
- 所提出的基于流的检测方法在不使用任何内容特征的情况下,实现了与 AdGraph 等基于内容的模型相当的检测准确率。
- 即使面对涉及结构图变异的更复杂规避策略,WebGraph 仍保持强鲁棒性,规避成功率受到显著限制,并伴随明显的可用性成本。
- 试图绕过 WebGraph 的攻击者会遭受非微不足道的附带损害,例如阻断自身或良性资源,从而限制了实际可行性。
- 现代网页的动态特性进一步阻碍了规避,因为变异必须在频繁的页面重载中保持有效。
- WebGraph 的设计支持逐步升级以覆盖新型追踪技术(如浏览器指纹识别),而无需完全重构架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。