Skip to main content
QUICK REVIEW

[論文レビュー] Cloaker Catcher: A Client-based Cloaking Detection System

Ruian Duan, Weiren Wang|arXiv (Cornell University)|Oct 3, 2017
Spam and Phishing Detection参考文献 16被引用数 3
ひとこと要約

Cloaker Catcher は、Simhashに基づくウェブサイトモデル(SWM)を用いて、ユーザー視点とクローラー視点を比較することで、リアルタイムにIPベースおよびSEMクローラークローラーを検出するクライアント側システムである。クリック詐欺を引き起こさず、プライバシーを保護しながら、低オーバーヘッドで正確なクローラー検出が可能であり、SEMクローラーが主に違法サービスを促進していることが判明した。

ABSTRACT

Cloaking has long been exploited by spammers for the purpose of increasing the exposure of their websites. In other words, cloaking has long served as a major malicious technique in search engine optimization (SEO). Cloaking hides the true nature of a website by delivering blatantly different content to users versus web crawlers. Recently, we have also witnessed a rising trend of employing cloaking in search engine marketing (SEM). However, detecting cloaking is challenging. Existing approaches cannot detect IP cloaking and are not suitable for detecting cloaking in SEM because their search-and-visit method leads to click fraud. In addition, they focus on detecting and measuring cloaking on the server side, but the results are not visible to users to help them avoid frauds. Our work focuses on mitigating IP cloaking and SEM cloaking, and providing client-based real-time cloaking detection services. To achieve these goals, we first propose the Simhash-based Website Model (SWM), a condensed representation of websites, which can model natural page dynamics. Based on SWM, we design and implement Cloaker Catcher, an accurate, efficient and privacy-preserving system, that consists of a server that crawls websites visited by users on demand and a client-side extension that fetches spider views of websites from the server and compares them with user views to detect cloaking. Since Cloaker Catcher checks on the client side for each real user, IP cloaking can be detected whenever it occurs and click fraud in SEM can also be prevented. Using our system, we conducted the first analysis of SEM cloaking and found that the main purpose of SEM cloakers is to provide illicit services.

研究の動機と目的

  • 既存のサーバーサイドシステムがユーザーに似た行動に依存するためクリック詐欺を引き起こすため、IPクローリングおよびSEMクローリングの検出におけるギャップを埋める。
  • ユーザーが潜在的にクロールされたサイトにアクセスした直後から直ちに保護される、クライアント側でリアルタイムにクローリング検出を実現する。
  • ネットワークおよび計算上のオーバーヘッドを最小限に抑える、軽量でプライバシー保護型のシステムを設計する。
  • 検出のスケーラビリティを高めるために、検索エンジンが大規模なクローリング検出にこのシステムを採用できるようにする。
  • 検索エンジンマーケティング(SEM)におけるクローリングの最初の実証的分析を実施し、多くのSEMクローラーが違法な意図を持っていることを明らかにする。

提案手法

  • 局所性に敏感なハッシュを用いて、ウェブサイトのコンテンツ、構造、リンクを組み合わせた、コンパクトで固定サイズのウェブサイトのフィンガープrint(SWM)を提案する。
  • クライアント側のブラウザ拡張機能を用いて、ユーザーが閲覧するウェブサイトのビューと、検索エンジンのIPを用いてサーバーから取得したクローラー視点を取得・比較する。
  • Simhashを用いてテキストコンテンツ、ハイパーリンク、HTMLタグを64ビットの署名に圧縮し、O(1)の類似度比較を可能にする。
  • Google翻訳を活用して検索エンジンのIPを特定し、IPクローリングの検出を保証する。
  • Safe Browsing などの既存のセキュリティAPIと統合し、リアルタイムの警告またはクロールされたコンテンツのブロッキングを提供する。
  • クラスタリングおよび類似度ヒューリスティクスを適用して、正当なウェブサイトのダイナミクスとクローリングを区別し、誤検出を低減する。

実験結果

リサーチクエスチョン

  • RQ1IPスプーフィングの影響を受けるサーバーサイド手法が失敗する状況下でも、クライアント側システムがIPクローリングを効果的に検出できるか。
  • RQ2サポーテッド広告モデルを前提とした場合、クリック詐欺を引き起こさずにSEMにおけるクローリング検出が可能か。
  • RQ3コンパクトでプライバシー保護型のウェブサイトモデル(SWM)が、ストレージおよび比較のオーバーヘッドを最小限に抑えつつ、ウェブサイトのダイナミクスを正確に表現できるか。
  • RQ4SEMクローリングの背後にある主な動機は何であり、SEOクローリングとはどのように異なるか。
  • RQ5クライアント側クローリング検出を、既存のブラウザセキュリティインfraに統合し、リアルタイム保護を実現する方法は何か。

主な発見

  • Cloaker Catcher は、ユーザーのIPと検索エンジンのIPを用いてビューを取得・比較することで、クローラーの隠蔽優位性を排除し、IPクローリングを効果的に検出できた。
  • 本システムは、広告への実際のユーザークリックを必要としないため、クリック詐欺を回避し、サポーテッド検索環境に適したSEMクローリング検出を可能にした。
  • Simhashに基づくウェブサイトモデル(SWM)により、ストレージと計算コストを最小限に抑えつつ、ウェブサイトスナップショットのO(1)比較が可能になった。
  • SEMクローリングの最初の分析から、クローラーが主に薬物やゴーストライティングなどの違法サービスを促進していることが判明し、SEOクローラーとは異なる動機を持つことが明らかになった。
  • Cloaker Catcher は、低オーバーヘッドで高い精度を達成しており、Safe Browsing などの既存のセキュリティフレームワークへの統合が実用的であることが示された。
  • コンテンツベースの特徴(SWM)とドメインベースの特徴(例:レピュテーション)を組み合わせることで、検出の正確性をさらに向上させられることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。