Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Fake Escrow Websites using Rich Fraud Cues and Kernel Based Methods

Ahmed Abbasi, Hsinchun Chen|arXiv (Cornell University)|Sep 27, 2013
Spam and Phishing Detection参考文献 13被引用数 8
ひとこと要約

本論文では、テキスト、視覚的、ハイパーリンク特徴といった豊富な詐欺兆候を組み合わせ、サポートベクターマシン(SVM)フレームワーク内で独自の合成カーネルを用いた機械学習的手法を提案する。この手法は、約90,000のウェブページにわたる410の実在および偽のエスクローWebサイトを区別する際、98%を超える正確性を達成し、自動化された詐欺検出システムの高い実現可能性を示している。

ABSTRACT

The ability to automatically detect fraudulent escrow websites is important in order to alleviate online auction fraud. Despite research on related topics, fake escrow website categorization has received little attention. In this study we evaluated the effectiveness of various features and techniques for detecting fake escrow websites. Our analysis included a rich set of features extracted from web page text, image, and link information. We also proposed a composite kernel tailored to represent the properties of fake websites, including content duplication and structural attributes. Experiments were conducted to assess the proposed features, techniques, and kernels on a test bed encompassing nearly 90,000 web pages derived from 410 legitimate and fake escrow sites. The combination of an extended feature set and the composite kernel attained over 98% accuracy when differentiating fake sites from real ones, using the support vector machines algorithm. The results suggest that automated web-based information systems for detecting fake escrow sites could be feasible and may be utilized as authentication mechanisms.

研究の動機と目的

  • オンラインオークション詐欺の増加する脅威に対処し、偽のエスクローWebサイトを検出すること。
  • テキスト、視覚的、ハイパーリンクベースの多様な特徴が、偽のエスクローWebサイトを同定するのにどの程度有効であるかを調査すること。
  • 重複やレイアウトの異常といった構造的およびコンテンツベースの詐欺インジケーターを捉える合成カーネルの開発。
  • 410の実在および偽のエスクローWebサイトからなる大規模データセット上で、提案手法のパフォーマンスを評価すること。
  • ユーザーがエスクロー基盤のオンライン詐欺から保護されるための、自動化可能でスケーラブルな認証メカニズムの基盤を確立すること。

提案手法

  • 潜在的な詐欺インジケーターを表現するため、ウェブページのコンテンツ、画像、ハイパーリンク構造から豊富な特徴を抽出した。
  • コンテンツの重複や構造的冗長性を含む、詐欺特徴の複雑なパターンをモデル化できるように、複数のカーネルタイプを統合した合成カーネルを設計した。
  • 合成カーネルを用いたサポートベクターマシン(SVM)を適用し、Webサイトを実在または偽物に分類した。
  • 訓練および評価のために、実在および偽のエスクローWebサイトの合計410サイトから収集された約90,000のウェブページのデータセットを用いた。
  • 分類の正確性を最大化するために、特徴選択とカーネルの組み合わせを最適化した。
  • バランスの取れた実在および偽のサイトのテストセットを用いて、標準的な指標(正確性など)でパフォーマンスを評価した。

実験結果

リサーチクエスチョン

  • RQ1テキスト、画像、リンクからの抽出された豊富な詐欺兆候は、偽のエスクローWebサイトと実在のものとを区別するのにどの程度有効であるか?
  • RQ2複数の詐欺特徴を統合する合成カーネルは、標準的なカーネルと比較して検出正確性を向上させることができるか?
  • RQ3多様なウェブベースの特徴を用いて訓練されたSVMベースの分類器は、偽のエスクロー検出においてどの程度のパフォーマンスを示すか?
  • RQ4コンテンツの重複と構造的異常は、偽のエスクローWebサイトの信頼できるインジケーターとしてどの程度の役割を果たすか?
  • RQ5自動検出システムは、スケールを考慮した場合に、偽のエスクローWebサイトを高精度で同定できるか?

主な発見

  • 拡張された特徴セットと提案された合成カーネルの組み合わせにより、偽のエスクローWebサイトの検出において98%を超える正確性が達成された。
  • 特にテキスト、画像、ハイパーリンク解析からの豊富な詐欺兆候の組み込みが、検出性能の顕著な向上に寄与した。
  • コンテンツの重複と構造的異常は、エスクローWebサイトにおける詐欺行動の強いインジケーターであることが同定された。
  • 合成カーネルは、詐欺シグナルの複雑で多次元的な性質を効果的にモデル化できたため、標準的なカーネル関数を上回る性能を示した。
  • 結果として、機械学習に基づく自動検出システムが、実世界のオンライン詐欺防止において非常に効果的かつ実現可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。