Skip to main content
QUICK REVIEW

[論文レビュー] WebGraph: Capturing Advertising and Tracking Information Flows for Robust Blocking

Sandra Siby, Umar Iqbal|arXiv (Cornell University)|Jul 23, 2021
Privacy, Security, and Data Protection参考文献 42被引用数 7
ひとこと要約

WebGraphは、URL やコードなどのコンテンツ特徴に依存するのではなく、識別子の保存や第三者間での共有といった情報フローをモデル化することで、広告およびトラッキングの検出にグラフベースの機械学習アプローチを導入する。この移行により、敵対的回避に対する耐性が著しく向上し、AdGraphでは96%であった回避成功率がWebGraphではたったの8%に低下する一方で、同等の検出精度を維持する。

ABSTRACT

Millions of web users directly depend on ad and tracker blocking tools to protect their privacy. However, existing ad and tracker blockers fall short because of their reliance on trivially susceptible advertising and tracking content. In this paper, we first demonstrate that the state-of-the-art machine learning based ad and tracker blockers, such as AdGraph, are susceptible to adversarial evasions deployed in real-world. Second, we introduce WebGraph, the first graph-based machine learning blocker that detects ads and trackers based on their action rather than their content. By building features around the actions that are fundamental to advertising and tracking - storing an identifier in the browser, or sharing an identifier with another tracker - WebGraph performs nearly as well as prior approaches, but is significantly more robust to adversarial evasions. In particular, we show that WebGraph achieves comparable accuracy to AdGraph, while significantly decreasing the success rate of an adversary from near-perfect under AdGraph to around 8% under WebGraph. Finally, we show that WebGraph remains robust to a more sophisticated adversary that uses evasion techniques beyond those currently deployed on the web.

研究の動機と目的

  • コンテンツ特徴(URL やコードなど)を簡単に操作可能なため、既存の機械学習ベースの広告・トラッキングブロッカーが敵対的回避に対して脆弱であるという問題に対処すること。
  • 広告およびトラッキングサービスの基本的行動(ユーザー識別子の保存や共有など)に焦点を当てた検出システムの開発。
  • URLのオブスカレーションやCNAMEクローラーなどの現実世界の回避技術に対する耐性の向上。
  • 洗練された、現実的で実用的な回避戦略に対する、提案手法の耐性の評価。
  • 行動ベースの検出(情報フロー特徴を用いて)が、コンテンツベースの検出に代わる実用的でより安全な代替手段であることを示すこと。

提案手法

  • ネットワークリクエスト、JavaScriptの実行、DOMの作成、ブラウザストレージアクセスを監視することで、ウェブページ実行のクロスレイヤー・グラフを構築する。
  • トラッカーからブラウザストレージ、および他の第三者エージェンシーへの識別子の伝播を明示的にモデル化するフロー特徴を抽出する。
  • Cookie や localStorage などの識別子の保存・取得を示す信号として、ブラウザAPIのインストルメンテーションを用いる。
  • ノードがリソースおよびブラウザAPIを表し、エッジがそれらの間の情報フローを表すグラフ表現を構築する。
  • コンテンツ特徴(URL やコードパターンなど)に完全に依存しない、これらのフロー特徴に基づいた機械学習分類器を訓練する。
  • 敵対的回避をシミュレートし、現実的な攻撃シナリオにおける耐性を評価するために、グリーディなグラフ変異アルゴリズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1現実世界の技術(URLのオブスカレーションやCNAMEクローリングなど)を用いて、最先端の機械学習ベースの広告・トラッキングブロッカーは回避可能か?
  • RQ2コンテンツ特徴に依存することで、広告・トラッキング検出システムが敵対的操作に対してどれほど脆弱になるか?
  • RQ3ブラウザAPIの相互作用から得られる情報フロー特徴は、コンテンツベースの検出に代わるより堅牢な代替手段となり得るか?
  • RQ4敵対者が洗練された現実的でグラフ変異技術を用いる場合、WebGraphはどれほど効果的に回避を防げるか?
  • RQ5WebGraphを回避しようとする際の、回避成功率とユーザビリティの損失のトレードオフはいかなるものか?

主な発見

  • URLのオブスカレーションやCNAMEクローリングなどの現実世界の回避技術を用いた場合、AdGraphでは96%であった敵対的回避成功率が、WebGraphではたったの8%に低下する。
  • 提案されたフロー特徴に基づく検出は、URL やコードパターンといったコンテンツ特徴を一切使用しないにもかかわらず、AdGraphのようなコンテンツベースのモデルと同等の検出精度を達成する。
  • 構造的グラフ変異を含むより洗練された回避戦略に対しても、WebGraphは強い耐性を維持し、回避成功率は限定的で、著しいユーザビリティコストを伴う。
  • WebGraphを回避しようとする攻撃者は、自らのリソースや無害なリソースをブロックする非軽微な付随的損害を被るため、実用的実行可能性が制限される。
  • 現代のウェブページの動的性質が、回避をさらに困難にする。変異は頻繁なページリロードに対しても有効でなければならない。
  • WebGraphの設計により、ブラウザフィンガープrintィングなどの新しいトラッキング技術に対応するための段階的インストルメンテーションのアップグレードが可能であり、完全なアーキテクチャ再設計を必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。