Skip to main content
QUICK REVIEW

[论文解读] Detecting Fake Escrow Websites using Rich Fraud Cues and Kernel Based Methods

Ahmed Abbasi, Hsinchun Chen|arXiv (Cornell University)|Sep 27, 2013
Spam and Phishing Detection参考文献 13被引用 8
一句话总结

本文提出了一种机器学习方法,通过结合丰富的欺诈线索(如文本、视觉和超链接特征)以及支持向量机(SVM)框架中的自定义复合核,检测虚假托管网站。该方法在近90,000个网页的410个真实与虚假托管网站中实现了超过98%的准确率,证明了其在自动化欺诈检测系统中的高度可行性。

ABSTRACT

The ability to automatically detect fraudulent escrow websites is important in order to alleviate online auction fraud. Despite research on related topics, fake escrow website categorization has received little attention. In this study we evaluated the effectiveness of various features and techniques for detecting fake escrow websites. Our analysis included a rich set of features extracted from web page text, image, and link information. We also proposed a composite kernel tailored to represent the properties of fake websites, including content duplication and structural attributes. Experiments were conducted to assess the proposed features, techniques, and kernels on a test bed encompassing nearly 90,000 web pages derived from 410 legitimate and fake escrow sites. The combination of an extended feature set and the composite kernel attained over 98% accuracy when differentiating fake sites from real ones, using the support vector machines algorithm. The results suggest that automated web-based information systems for detecting fake escrow sites could be feasible and may be utilized as authentication mechanisms.

研究动机与目标

  • 为应对在线拍卖欺诈日益增长的威胁,检测欺诈性托管网站。
  • 探究多样化特征(文本、视觉和超链接)在识别虚假托管网站方面的有效性。
  • 开发一种复合核,以捕捉结构和内容相关的欺诈指标,如重复和布局异常。
  • 在包含410个真实与虚假托管网站的大规模数据集上评估所提出方法的性能。
  • 为自动化、可扩展的认证机制奠定基础,以保护用户免受基于托管的在线欺诈侵害。

提出的方法

  • 从网页内容、图像和超链接结构中提取丰富的特征,以表示潜在的欺诈指标。
  • 设计一种复合核,整合多种核类型,以建模欺诈特征中的复杂模式,包括内容重复和结构冗余。
  • 在支持向量机(SVM)中应用复合核,将网站分类为真实或虚假。
  • 使用从410个不同托管网站(包括合法和欺诈性网站)收集的近90,000个网页数据集进行训练和评估。
  • 通过优化特征选择和核组合,以最大化分类准确率。
  • 使用标准指标(包括准确率)在真实与虚假网站平衡的测试集上评估性能。

实验结果

研究问题

  • RQ1从文本、图像和链接中提取的丰富欺诈线索,在区分虚假托管网站与合法网站方面有多有效?
  • RQ2与标准核函数相比,整合多种欺诈特异性特征的复合核是否能提高检测准确率?
  • RQ3当基于多样化的基于网页的特征训练时,基于SVM的分类器在虚假托管网站检测中的表现如何?
  • RQ4内容重复和结构异常在多大程度上可作为欺诈性托管网站的可靠指标?
  • RQ5自动化检测系统能否在大规模场景下实现高准确率,识别虚假托管网站?

主要发现

  • 扩展的特征集与所提出的复合核相结合,在检测虚假托管网站方面实现了超过98%的准确率。
  • 丰富欺诈线索(尤其是来自文本、图像和超链接分析的线索)显著提升了检测性能。
  • 内容重复和结构异常被识别为托管网站欺诈行为的强有力指标。
  • 复合核通过有效建模欺诈信号的复杂多维特性,优于标准核函数。
  • 结果表明,基于机器学习的自动化检测系统在现实世界在线欺诈防范中具有高度有效性与可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。