Skip to main content
QUICK REVIEW

[论文解读] Scraping and Preprocessing Commercial Auction Data for Fraud Classification

Ahmad A. Alzahrani, Samira Sadaoui|arXiv (Cornell University)|Jun 2, 2018
Auction Theory and Applications参考文献 9被引用 11
一句话总结

本文基于真实eBay拍卖的iPhone 7s交易,通过网络爬虫和严格的数据清洗,构建了一个大规模、高质量的盗拍(shill bidding, SB)行为模式数据集。该研究应用了八种SB检测模式识别可疑出价者,共获得6,321个带标签的实例,并提供一个公开可获取的真实数据集,用于训练和评估机器学习模型以应对拍卖欺诈问题。

ABSTRACT

In the last three decades, we have seen a significant increase in trading goods and services through online auctions. However, this business created an attractive environment for malicious moneymakers who can commit different types of fraud activities, such as Shill Bidding (SB). The latter is predominant across many auctions but this type of fraud is difficult to detect due to its similarity to normal bidding behaviour. The unavailability of SB datasets makes the development of SB detection and classification models burdensome. Furthermore, to implement efficient SB detection models, we should produce SB data from actual auctions of commercial sites. In this study, we first scraped a large number of eBay auctions of a popular product. After preprocessing the raw auction data, we build a high-quality SB dataset based on the most reliable SB strategies. The aim of our research is to share the preprocessed auction dataset as well as the SB training (unlabelled) dataset, thereby researchers can apply various machine learning techniques by using authentic data of auctions and fraud.

研究动机与目标

  • 为解决在线拍卖欺诈检测中真实、带标签的盗拍(SB)数据集稀缺的问题,以支持机器学习模型的训练。
  • 开发一个可复现的流程,用于从eBay等商业平台提取、清洗和预处理原始拍卖数据。
  • 基于出价序列推导出八种不同的行为模式,识别并量化盗拍行为。
  • 基于真实拍卖数据,构建一个可靠、高质量的SB训练数据集,包含带标签的实例,以支持稳健的欺诈分类研究。
  • 通过公开发布预处理后的数据集和SB行为模式,支持未来学术界与工业界在欺诈检测领域的研究。

提出的方法

  • 使用自动化脚本对807场eBay iPhone 7s拍卖进行网络爬取,提取拍卖级和出价级数据。
  • 对原始拍卖数据进行预处理,以标准化出价时间、出价比率和拍卖起拍价等属性。
  • 定义并计算八种盗拍检测模式:出价者倾向、早期出价、出价比率、最后出价、起拍价、连续加价、中签比率和拍卖出价数。
  • 应用归一化函数将模式得分缩放到[0, 1]区间,确保一致性并消除非活跃用户带来的偏差。
  • 将每个出价者-拍卖对的模式得分聚合为一个10维特征向量(拍卖ID、出价者ID及八个模式得分),构成每个实例的输入。
  • 通过检查异常值并确保所有数值均在[0, 1]范围内,验证数据集的完整性。

实验结果

研究问题

  • RQ1在在线拍卖中,哪些行为模式最能可靠地区分盗拍者与合法出价者?
  • RQ2如何系统性地从现实拍卖数据中进行网络爬取和预处理,以构建高保真度的欺诈检测数据集?
  • RQ3在真实商业拍卖中,常见的盗拍行为(如早期出价、连续加价和最后时刻出价)在多大程度上实际发生?
  • RQ4能否构建一个大规模、公开可用的真实拍卖行为数据集,以支持基于机器学习的欺诈检测研究?
  • RQ5在真实世界的SB数据集中,如何有效处理正常与可疑出价行为之间的类别不平衡问题,以支持模型的有效训练?

主要发现

  • 最终的SB数据集包含807场拍卖中的6,321个实例,涉及1,054个唯一出价者ID,代表了全面且多样的出价行为样本。
  • 26.25%的出价者表现出激进的连续加价行为但未中签,表明存在强烈的盗拍活动证据。
  • 46.6%的出价者参与了起拍价较低的拍卖,表明其策略性地利用低价以触发竞争性出价。
  • 31.26%的出价者在拍卖后期才开始活跃,该行为与最后时刻操纵出价的特征一致。
  • 31.13%的出价者表现出连续加价行为,多次激进地提高出价,是盗拍行为的关键指标。
  • 归一化后的模式得分中未发现异常值,表明预处理后数据质量与可靠性得到充分验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。