Skip to main content
QUICK REVIEW

[論文レビュー] I Spy with My Little Eye: Analysis and Detection of Spying Browser Extensions

Anupama Aggarwal, Bimal Viswanath|arXiv (Cornell University)|Dec 2, 2016
Spam and Phishing Detection被引用数 4
ひとこと要約

本論文では、閲覧履歴、OSNトークン、位置情報などの機微なユーザー情報を漏洩させるスパイ用ブラウザ拡張機能を検出するための機械学習手法を提示する。ブラウザAPI呼び出しシーケンスを再帰的ニューラルネットワーク(RNN)でモデル化することで、悪意ある拡張機能の識別において90.02%の精度と93.31%の再現率を達成し、従来の手作業で特徴を設計する手法を上回った。

ABSTRACT

Several studies have been conducted on understanding third-party user tracking on the web. However, web trackers can only track users on sites where they are embedded by the publisher, thus obtaining a fragmented view of a user's online footprint. In this work, we investigate a different form of user tracking, where browser extensions are repurposed to capture the complete online activities of a user and communicate the collected sensitive information to a third-party domain. We conduct an empirical study of spying browser extensions on the Chrome Web Store. First, we present an in-depth analysis of the spying behavior of these extensions. We observe that these extensions steal a variety of sensitive user information, such as the complete browsing history (e.g., the sequence of web traversals), online social network (OSN) access tokens, IP address, and user geolocation. Second, we investigate the potential for automatically detecting spying extensions by applying machine learning schemes. We show that using a Recurrent Neural Network (RNN), the sequences of browser API calls can be a robust feature, outperforming hand-crafted features (used in prior work on malicious extensions) to detect spying extensions. Our RNN based detection scheme achieves a high precision (90.02%) and recall (93.31%) in detecting spying extensions.

研究の動機と目的

  • 閲覧履歴、OSNトークン、位置情報などの機微なユーザー情報を盗み取るスパイ用ブラウザ拡張機能の広がりと行動様式を理解すること。
  • 複雑な手作業による特徴設計に依存せずに、自動的にこのような拡張機能を検出できるかの妥当性を調査すること。
  • 順序付けられたブラウザAPI呼び出しパターンが、スパイ行動を検出するための強固で高性能な特徴として機能できるかを検証すること。
  • 既存の特徴工学的手法を上回る性能を示すRNNベースの検出モデルの開発と検証を行うこと。

提案手法

  • 著者らは、1,000を超えるChrome Web Store拡張機能の動作ログ(ネットワーク、ストレージ、APIリクエスト)を手作業で分析し、218のスパイ拡張機能を同定することで、正解ラベル付きのデータセットを構築した。
  • 候補となる43,521の拡張機能のセットに対してヒューリスティクスを適用し、人的作業を削減しながらも検出精度を維持した。
  • 本手法の核となるのは、ブラウザAPI呼び出しシーケンスを順序データとしてモデル化し、再帰的ニューラルネットワーク(RNN)を用いてスパイ行動を示す複雑な時間的パターンを学習することである。
  • RNNはAPI呼び出しのシーケンスを学習することで、スパイ拡張機能に共通するオブフスケーションや状態切り替えといった動的行動を捉える。
  • 従来の特徴工学的アプローチとは異なり、本手法は単に原始的なAPI呼び出しシーケンスに依存するため、膨大な手作業による特徴設計の必要がなくなる。
  • モデルは、事前に学習に使用しなかった65の未確認拡張機能を含むホールドアウトセットで評価され、新たなスパイ拡張機能を正常に同定した。

実験結果

リサーチクエスチョン

  • RQ1スパイ用ブラウザ拡張機能は、Chrome Web Storeでどれほど広がっており、どのような機微なユーザー情報を通常盗み取るのか?
  • RQ2順序付けられたブラウザAPI呼び出しパターンは、手作業で設計された特徴よりも、スパイ拡張機能検出に効果的であると期待できるか?
  • RQ3特徴を手作業で設計する従来の機械学習手法と比較して、RNNベースのモデルはスパイ拡張機能検出においてどのように性能を発揮するか?
  • RQ4RNNモデルは、学習に使用しなかったスパイ拡張機能をどの程度一般化して検出できるか?

主な発見

  • 本研究では、Chrome Web Storeに218のスパイ拡張機能を同定したが、その多くは悪意のない拡張機能と同様に人気で高評価を受けており、ユーザーの無自覚な利用が広がっていることを示している。
  • スパム拡張機能は、完全な閲覧履歴、OSNアクセストークン、IPアドレス、位置情報など、幅広い機微なデータを盗み取り、しばしば第三者ドメインにデータを漏洩させている。
  • RNNベースの検出モデルは、93.31%の再現率と90.02%の精度を達成し、スパイ行動の検出において、手作業による特徴設計に基づく手法を顕著に上回った。
  • API呼び出しシーケンスが最も予測能の高い特徴であることが判明し、複雑な特徴設計や静的コード解析への依存なしに検出が可能であることを示した。
  • モデルは、学習に使用しなかった65の新しいスパイ拡張機能を正常に検出でき、一般化性能と実世界への適用可能性が強く裏付けられた。
  • 一部の拡張機能では、スパイ行動と非スパイ行動の間で動的に切り替わる状態が観察され、検出の難易度を高めており、行動分析の重要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。