Skip to main content
QUICK REVIEW

[论文解读] Evaluating resampling methods on a real-life highly imbalanced online credit card payments dataset

François de la Bourdonnaye, Fabrice Daniel|arXiv (Cornell University)|Jun 27, 2022
Imbalanced Data Classification Techniques被引用 6
一句话总结

本研究使用梯度提升模型(XGBoost、LightGBM、CatBoost)在大规模、真实在线信用卡欺诈数据集上评估了最先进的重采样方法。尽管召回率显著提升,但重采样方法严重降低了精确率和PR AUC,表明在该高度不平衡的数据集中其效果不佳,仅使用梯度提升模型的表现优于所有重采样策略。

ABSTRACT

Various problems of any credit card fraud detection based on machine learning come from the imbalanced aspect of transaction datasets. Indeed, the number of frauds compared to the number of regular transactions is tiny and has been shown to damage learning performances, e.g., at worst, the algorithm can learn to classify all the transactions as regular. Resampling methods and cost-sensitive approaches are known to be good candidates to leverage this issue of imbalanced datasets. This paper evaluates numerous state-of-the-art resampling methods on a large real-life online credit card payments dataset. We show they are inefficient because methods are intractable or because metrics do not exhibit substantial improvements. Our work contributes to this domain in (1) that we compare many state-of-the-art resampling methods on a large-scale dataset and in (2) that we use a real-life online credit card payments dataset.

研究动机与目标

  • 评估最先进的重采样技术在大规模、真实在线信用卡支付数据集(存在极端类别不平衡)中的有效性。
  • 确定重采样是否能提升关键欺诈检测指标,如精确率、召回率、F1和PR AUC。
  • 在计算资源受限的情况下,识别适用于最多包含一千万条样本数据集的可行重采样方法。
  • 比较多种梯度提升模型(XGBoost、LightGBM、CatBoost)在有无重采样情况下的性能表现。
  • 为现实世界欺诈检测场景中重采样技术的局限性提供实证证据。

提出的方法

  • 本研究应用了7种最先进的重采样方法:随机过采样、随机欠采样、SMOTE、边界SMOTE、ADASYN、最近邻近邻近(NearMiss)以及实例硬度阈值(IHT)。
  • 重采样应用于一个存在极端类别不平衡的真实在线信用卡支付数据集,其中欺诈案例仅占总交易的极小比例。
  • 在重采样和原始数据集上分别训练了三种梯度提升模型——XGBoost、LightGBM和CatBoost,以评估性能差异。
  • 通过精确率、召回率、F1分数和PR AUC来衡量性能,结果以相对于基线(无重采样)的百分比变化形式报告。
  • 通过在配备80个超线程核心和1TB内存的高性能集群上测量实际重采样时间,评估计算可行性。
  • 分析重点在于召回率提升与精确率下降之间的权衡,特别是评估少数类检测的改进是否被误报增加所抵消。

实验结果

研究问题

  • RQ1最先进的重采样方法是否在真实、大规模、高度不平衡的在线信用卡数据集中显著提升欺诈检测性能?
  • RQ2哪些重采样方法在最多包含一千万条样本的数据集中具有计算可行性?
  • RQ3在现实欺诈检测中,重采样方法在提升召回率的同时,对精确率和PR AUC的损害程度如何?
  • RQ4不同梯度提升模型(XGBoost、LightGBM、CatBoost)在该数据集上使用与不使用重采样时的表现如何?
  • RQ5总体而言,重采样技术是否有效,还是尽管提升了召回率,却导致关键指标下降?

主要发现

  • 实例硬度阈值、随机欠采样和边界SMOTE使召回率最高提升841%,F1最高提升96%,但PR AUC下降31%–68%,精确率下降77%–99%。
  • SMOTE和ADASYN使PR AUC下降59%–67%,精确率下降91%–93%,而召回率提升527%–836%,表明存在严重权衡。
  • NEAR MISS实现最高召回率增幅(1657%),但导致PR AUC下降97%、精确率下降99%,使其在实际应用中无效。
  • 所有重采样方法均显著降低PR AUC和精确率,无任何方法在所有指标上实现显著净提升。
  • 结果表明,重采样在此数据集中无效,且仅使用梯度提升模型的表现优于任何重采样策略。
  • 本研究得出结论:梯度提升模型本身比重采样更能有效处理类别不平衡,尤其通过聚焦于难分类样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。