Skip to main content
QUICK REVIEW

[论文解读] Applying support vector data description for fraud detection

Mohamad Khedmati, Masoud Erfani|arXiv (Cornell University)|May 31, 2020
Imbalanced Data Classification Techniques参考文献 6被引用 4
一句话总结

本文提出了一种基于支持向量数据描述(SVDD)的一类欺诈检测框架,以消除对难以获取的标注欺诈样本的需求。该方法引入了REDBSCAN,一种增强版DBSCAN算法,可在保留数据形状的同时减少训练数据量,显著加速SVDD的训练过程。该方法在仅使用10%的非欺诈数据进行训练的情况下,实现了0.9775的AUC,优于传统SVM在准确率和速度方面的表现,展现出卓越的性能。

ABSTRACT

Fraud detection is an important topic that applies to various enterprises such as banking and financial sectors, insurance, government agencies, law enforcement, and more. Fraud attempts have been risen remarkably in current years, shaping fraud detection an essential topic for research. One of the main challenges in fraud detection is acquiring fraud samples which is a complex and challenging task. In order to deal with this challenge, we apply one-class classification methods such as SVDD which does not need the fraud samples for training. Also, we present our algorithm REDBSCAN which is an extension of DBSCAN to reduce the number of samples and select those that keep the shape of data. The results obtained by the implementation of the proposed method indicated that the fraud detection process was improved in both performance and speed.

研究动机与目标

  • 为解决现实欺诈检测系统中难以获取且数量稀少的标注欺诈样本问题。
  • 通过在不损失数据分布特征的前提下减少非欺诈训练数据规模,提升欺诈检测的效率与性能。
  • 评估一类分类方法(特别是SVDD)相较于传统二类分类器(如SVM)在欺诈检测中的有效性。
  • 开发并验证一种新型数据缩减算法REDBSCAN,作为DBSCAN的扩展,以提升训练速度与模型泛化能力。

提出的方法

  • 作者采用支持向量数据描述(SVDD)这一一类分类方法,仅使用非欺诈样本学习围绕正常(非欺诈)数据点的边界。
  • 提出REDBSCAN,一种增强版DBSCAN算法,能从非欺诈数据中选取具有代表性的样本,同时保持底层数据结构。
  • 利用REDBSCAN生成的缩减版非欺诈数据集训练SVDD模型,从而提升训练速度与内存效率。
  • 通过AUC、精确率、召回率和F1值等指标,对比SVDD与传统SVM在合成移动支付数据集上的性能表现。
  • 训练过程使用D.M.J. Tax开发的MATLAB工具箱(dd-tools与pr-tools)实现SVDD。
  • 采用30%的测试集评估SVDD与SVM的性能,其中SVDD仅在10%的非欺诈数据上进行训练,而SVM则在包含欺诈样本的完整数据集的70%上进行训练。

实验结果

研究问题

  • RQ1使用SVDD的一类分类方法是否能在无需标注欺诈样本的情况下实现高精度的欺诈检测?
  • RQ2所提出的REDBSCAN算法在保持数据分布完整性的同时,如何提升数据缩减效率?
  • RQ3当仅使用极少的非欺诈数据进行训练时,SVDD相较于传统二类SVM在AUC、精确率、召回率和F1值方面有何性能提升?
  • RQ4通过REDBSCAN进行数据缩减在多大程度上加速了SVDD的训练过程,同时不降低模型性能?

主要发现

  • SVDD实现了0.9775的AUC,显著优于SVM的0.9460,尽管其仅在10%的非欺诈数据上进行训练。
  • SVDD的精确率为0.9194,高于SVM的0.8441,表明其能更准确地识别真实欺诈案例。
  • SVDD的召回率为0.8557,高于SVM的0.7550,显示出对实际欺诈实例更高的检测能力。
  • SVDD的F1值为0.8864,高于SVM的0.7971,证实其整体分类平衡更优。
  • 使用REDBSCAN进行数据缩减后,SVDD的训练时间从194秒降至1.69秒,展现出显著的速度提升。
  • 当SVM的训练数据量减少至与SVDD相同的10%时,其AUC下降,而SVDD的AUC保持稳定,证实了一类方法的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。