Skip to main content
QUICK REVIEW

[論文レビュー] Actions speak louder than words: Semi-supervised learning for browser fingerprinting detection

Sarah Bird, Vikash Kumar Mishra|arXiv (Cornell University)|Mar 9, 2020
Internet Traffic Analysis and Secure E-voting参考文献 43被引用数 5
ひとこと要約

本論文は、APIアクセスパターンの行動的類似性を活用して、JavaScript実行トレースを分析することにより、ブラウザフィンガープrintスクリプトを検出する半教師あり機械学習手法を提案する。既知のフィンガープリントスクリプトに対して94.9%の再現率を達成し、実世界で100件以上の未検出のデバイスクラスフィンガープリントスクリプトを発見した。これは、このフィンガープリントスクリプトクラスの初の実証的測定である。

ABSTRACT

As online tracking continues to grow, existing anti-tracking and fingerprinting detection techniques that require significant manual input must be augmented. Heuristic approaches to fingerprinting detection are precise but must be carefully curated. Supervised machine learning techniques proposed for detecting tracking require manually generated label-sets. Seeking to overcome these challenges, we present a semi-supervised machine learning approach for detecting fingerprinting scripts. Our approach is based on the core insight that fingerprinting scripts have similar patterns of API access when generating their fingerprints, even though their access patterns may not match exactly. Using this insight, we group scripts by their JavaScript (JS) execution traces and apply a semi-supervised approach to detect new fingerprinting scripts. We detail our methodology and demonstrate its ability to identify the majority of scripts ($\\geqslant$94.9%) identified by existing heuristic techniques. We also show that the approach expands beyond detecting known scripts by surfacing candidate scripts that are likely to include fingerprinting. Through an analysis of these candidate scripts we discovered fingerprinting scripts that were missed by heuristics and for which there are no heuristics. In particular, we identified over one hundred device-class fingerprinting scripts present on hundreds of domains. To the best of our knowledge, this is the first time device-class fingerprinting has been measured in the wild. These successes illustrate the power of a sparse vector representation and semi-supervised learning to complement and extend existing tracking detection techniques.

研究の動機と目的

  • 手動でのキュレーションやラベル付きデータセットに依存するヒューリスティック手法や教師あり手法の限界を是正すること。
  • 未知のフィンガープリントスクリプトを、JavaScript実行トレース内の行動的類似性を特定することで検出すること。
  • 実際のWeb配信環境におけるデバイスクラスフィンガープリントの存在を測定・検証すること。
  • 完全な手動ラベリングを必要としない、スケーラブルで半自動のコンテンツブロッカー・リスト拡張手法を開発すること。

提案手法

  • 各スクリプトごとのAPI呼び出しのスパースベクトルとしてJavaScript実行トレースを表現し、ベクトル空間における行動比較を可能にする。
  • 既知のフィンガープリントスクリプトをシード例として用い、分布的類似性を介して未知スクリプト内の類似した行動パターンを同定する。
  • 少数のラベル付きスクリプトからラベルを大規模な未ラベルスクリプトに伝搬する半教師あり学習フレームワークを適用する。
  • 手動キュレーションに依存を減らすために、キーワードベースのシードセットを用いたプログラム的ラベリング戦略を採用する。
  • API呼び出しシーケンスをスクリプトレベルで「スニペット」に集約し、各スクリプトごとの行動分析を可能にする。
  • 約130万件の固有スクリプトURLと1億1400万件のAPI呼び出しを含むOverScripted Webクロールデータセットを用いて、手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1少数の既知の例のみを用いて、半教師ありアプローチが高再現率でフィンガープリントスクリプトを検出可能か?
  • RQ2コードのオブスクリューションや変種があっても、フィンガープリントスクリプトはAPIアクセスシーケンスにおいて一貫した行動的パターンを示すか?
  • RQ3本手法は、既存のヒューリスティクスが見逃している、例えばデバイスクラスフィンガープリントのような新しいフィンガープリントクラスを同定可能か?
  • RQ4初期ラベリングに最先端のヒューリスティクスではなくキーワードベースのシードセットを用いた場合、本手法の有効性はいかがなものか?
  • RQ5本手法は、現行の検出ヒューリスティクスがカバーしていないスクリプトを含め、実世界のWeb配信環境にスケーラブルに適用可能か?

主な発見

  • 本手法は、最先端のヒューリスティクス技術で同定されたフィンガープリントスクリプトの少なくとも94.9%を検出可能である。
  • 本手法は、数百のドメインにわたり、100件を超える未発見のデバイスクラスフィンガープリントスクリプトを正常に同定した。
  • これは、実世界におけるデバイスクラスフィンガープリントの初の実証的測定であり、以前に観察されていなかったフィンガープリントパターンを明らかにした。
  • キーワードベースのシードセットを用いた場合でも、モデルは良好に一般化され、不完全または不正確なラベリングに対しても頑健であることが示された。
  • JS実行トレースのベクトル表現により、オブスクリューションや変更を加えられたフィンガープリントスクリプトの行動的類似性を効果的に検出可能である。
  • 既知のフィンガープリントスクリプトに類似しているが、既存のヒューリスティクスを回避できるほど十分に異なる候補スクリプトを同定でき、予防的検出が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。