[论文解读] Synthetic Data Generation for Fraud Detection using GANs
本文提出 SDG-GAN,一种基于生成对抗网络的框架,用于生成合成数据,以解决在线博彩欺诈检测中的类别不平衡问题。通过生成高质量的少数类实例,SDG-GAN 显著提升了分类器性能,在基准数据集和真实世界博彩欺诈数据集上,相较于基于规则的系统,F1 分数提升 5%,并优于 SMOTE、ADASYN、B-SMOTE 和 cGAN。
Detecting money laundering in gambling is becoming increasingly challenging for the gambling industry as consumers migrate to online channels. Whilst increasingly stringent regulations have been applied over the years to prevent money laundering in gambling, despite this, online gambling is still a channel for criminals to spend proceeds from crime. Complementing online gambling's growth more concerns are raised to its effects compared with gambling in traditional, physical formats, as it might introduce higher levels of problem gambling or fraudulent behaviour due to its nature of immediate interaction with online gambling experience. However, in most cases the main issue when organisations try to tackle those areas is the absence of high quality data. Since fraud detection related issues face the significant problem of the class imbalance, in this paper we propose a novel system based on Generative Adversarial Networks (GANs) for generating synthetic data in order to train a supervised classifier. Our framework Synthetic Data Generation GAN (SDG-GAN), manages to outperformed density based over-sampling methods and improve the classification performance of benchmarks datasets and the real world gambling fraud dataset.
研究动机与目标
- 为解决在线博彩欺诈检测中欺诈案例远少于正常案例这一关键挑战。
- 开发一种稳健的合成数据生成方法,以提升在类别不平衡、结构化数据集上的监督学习性能。
- 评估基于 GAN 的过采样方法相较于传统和对抗性采样技术在真实世界欺诈检测场景中的有效性。
- 通过改进的数据增强,提升在线博彩平台中高风险洗钱案例的识别率。
- 在公开基准数据集和一个真实世界匿名博彩欺诈数据集上验证所提方法的有效性。
提出的方法
- SDG-GAN 采用条件 GAN 架构,生成少数类(欺诈)的合成实例,同时保留数据的底层分布。
- 生成器网络通过最小化与判别器的对抗损失,学习生成逼真的合成样本,该判别器负责区分真实与伪造数据。
- 该框架被整合进监督学习流程中,合成样本在训练分类器前用于对少数类进行过采样。
- 采用四种分类器进行评估:逻辑回归(LR)、随机森林(RF)、多层感知机(MLP)和 XGBoost(XGB)。
- 性能通过 F1 分数、精确率和召回率进行衡量,并采用统计排名方法与 SMOTE、ADASYN、B-SMOTE 和 cGAN 进行比较。
- 模型在公开数据集(信用卡欺诈、威斯康星州乳腺癌、Pima 糖尿病)和一个真实世界博彩欺诈数据集(共 4,700 个样本,其中 1,200 个为高风险案例)上进行训练。
实验结果
研究问题
- RQ1基于 GAN 的合成数据生成方法是否能有效提升在类别不平衡欺诈检测数据集上监督分类器的性能?
- RQ2SDG-GAN 在 F1 分数和分类可靠性方面与 SMOTE、ADASYN 和 B-SMOTE 等成熟过采样技术相比表现如何?
- RQ3使用 SDG-GAN 是否能显著提升在真实世界在线博彩数据中识别高风险洗钱案例的能力?
- RQ4SDG-GAN 是否能比传统方法或其他基于 GAN 的方法更有效地生成捕捉结构化欺诈数据中复杂非线性模式的高质量合成数据?
- RQ5SDG-GAN 的性能增益是否在不同机器学习模型和多样化数据分布下保持一致?
主要发现
- 在所有分类器和数据集上,SDG-GAN 的总体排名最高(平均排名 2.6),优于 SMOTE、ADASYN、B-SMOTE 和 cGAN。
- 在真实世界博彩欺诈数据集中,当与 XGBoost 结合使用时,SDG-GAN 的 F1 分数达到 89.73%,相比现有基于规则的系统提升了 5%。
- 与基线技术相比,该方法降低了误报率和漏报率,增强了模型区分正常客户与高风险客户的能力。
- 在使用随机森林时,SDG-GAN 在三个基准数据集中的两个上表现优于其他方法,实现了最佳 F1 分数。
- 在博彩欺诈数据集上,SDG-GAN 相较于 SMOTE 的 F1 分数提升约 0.4%,表明其增益虽为渐进式但具有一致性。
- 结果支持假设:SDG-GAN 能够有效估计复杂数据分布,并在类别不平衡的欺诈检测任务中提升少数类检测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。