[论文解读] Fraud Dataset Benchmark and Applications
本文提出了欺诈数据集基准(FDB),这是一个标准化的公开欺诈检测数据集集合,涵盖非面对面交易欺诈、机器人攻击、恶意URL、贷款违约以及内容审核等场景。FDB 提供了一致的 Python API 用于数据加载,并包含预定义的训练/测试集划分,支持对欺诈检测技术在类别不平衡、高基数特征和对抗性模式变化等关键挑战下的系统性评估。实证结果表明,三重训练和混合自训练方法优于基线模型。
Standardized datasets and benchmarks have spurred innovations in computer vision, natural language processing, multi-modal and tabular settings. We note that, as compared to other well researched fields, fraud detection has unique challenges: high-class imbalance, diverse feature types, frequently changing fraud patterns, and adversarial nature of the problem. Due to these, the modeling approaches evaluated on datasets from other research fields may not work well for the fraud detection. In this paper, we introduce Fraud Dataset Benchmark (FDB), a compilation of publicly available datasets catered to fraud detection FDB comprises variety of fraud related tasks, ranging from identifying fraudulent card-not-present transactions, detecting bot attacks, classifying malicious URLs, estimating risk of loan default to content moderation. The Python based library for FDB provides a consistent API for data loading with standardized training and testing splits. We demonstrate several applications of FDB that are of broad interest for fraud detection, including feature engineering, comparison of supervised learning algorithms, label noise removal, class-imbalance treatment and semi-supervised learning. We hope that FDB provides a common playground for researchers and practitioners in the fraud detection domain to develop robust and customized machine learning techniques targeting various fraud use cases.
研究动机与目标
- 为解决欺诈检测领域缺乏针对特定挑战(如极端类别不平衡和对抗性行为)的标准化、公开可用基准的问题。
- 为研究人员和从业者提供一个统一、可复现的平台,用于评估和比较欺诈检测模型,而无需依赖专有或私有数据。
- 通过提供多样化的、真实世界的欺诈用例、一致的数据划分和特征命名,支持开发鲁棒且可泛化的机器学习技术。
- 促进关键欺诈检测应用领域的研究,如标签噪声去除、类别不平衡缓解以及半监督学习。
提出的方法
- FDB 汇集了来自 Kaggle、UCI 和 OpenML 等来源的九个公开可用的二分类欺诈检测数据集,涵盖交易欺诈、机器人检测和信用风险等多种欺诈类型。
- 实现了一个 Python 库,提供标准化 API 将数据集加载为 Pandas DataFrame,包括自动的训练/测试集划分和一致的特征命名。
- 该基准支持数据采样、为 AutoML 框架生成虚拟变量,并与流行的机器学习库(如 scikit-learn、XGBoost 和 CatBoost)集成。
- 评估了四个关键应用场景:使用传统机器学习和 AutoML 的监督学习、标签噪声检测、类别不平衡处理,以及基于自训练和三重训练的半监督学习。
- 半监督学习通过自训练、三重训练和 VIME 进行测试,并通过消融研究比较完整框架与从自学习步骤中提取特征的效果。
- 实验在七个数据集上、四种标注率(5% 至 50%)下进行,性能通过 AUC 评估,并按数据集和标注比例进行排序。
实验结果
研究问题
- RQ1在具有统一数据划分和特征规范的标准化欺诈检测数据集上,不同监督学习算法的表现如何?
- RQ2标签噪声检测技术能否有效识别在极端类别不平衡的现实欺诈数据集中被错误标注的样本?
- RQ3各种类别不平衡缓解策略在极端欺诈交易与正常交易比例下的模型泛化能力提升效果如何?
- RQ4在有限标注数据条件下,哪种半监督学习方法——自训练、三重训练或 VIME——在多样化的欺诈检测任务中表现最佳?
- RQ5将无标签数据中的表示学习与树模型(如 CatBoost)结合,能否提升下游欺诈检测性能?
主要发现
- 默认配置下的三重训练在 28 个实验配置中的 10 个(7 个数据集 × 4 种标注率)中表现最佳,排名第一。
- 保守型三重训练在 10 种情况下排名第一,表明其在处理噪声或模糊样本时具有更高的鲁棒性。
- 自训练在任何场景下均未取得最佳性能,可能由于过拟合,这是该方法已知的局限性。
- 默认的 VIME 框架表现较差,仅在 fakejob 数据集上排名第一一次,表明其在表格型欺诈数据上的效果有限。
- 将自学习表示与 CatBoost 结合在某些情况下提升了性能,但未显著优于基线,表明该混合方法的增益有限。
- 该基准实现了在多样化欺诈检测任务中的稳定、可复现评估,减少了与数据分布和划分差异相关的混杂因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。