[论文解读] Solving the "false positives" problem in fraud prediction
本文提出一种使用深度特征合成(DFS)的自动化特征工程方法,以减少欺诈检测中的误报,从历史数据中为每笔交易生成237个行为特征。该方法将误报减少了54%,在185万笔未见交易中节省了19万欧元,即使特征仅每35天更新一次,性能损失也极小。
In this paper, we present an automated feature engineering based approach to dramatically reduce false positives in fraud prediction. False positives plague the fraud prediction industry. It is estimated that only 1 in 5 declared as fraud are actually fraud and roughly 1 in every 6 customers have had a valid transaction declined in the past year. To address this problem, we use the Deep Feature Synthesis algorithm to automatically derive behavioral features based on the historical data of the card associated with a transaction. We generate 237 features (>100 behavioral patterns) for each transaction, and use a random forest to learn a classifier. We tested our machine learning model on data from a large multinational bank and compared it to their existing solution. On an unseen data of 1.852 million transactions, we were able to reduce the false positives by 54% and provide a savings of 190K euros. We also assess how to deploy this solution, and whether it necessitates streaming computation for real time scoring. We found that our solution can maintain similar benefits even when historical features are computed once every 7 days.
研究动机与目标
- 解决欺诈检测中高误报率这一长期问题,其成本甚至超过欺诈本身。
- 开发一种透明、自动化的机器学习解决方案,利用丰富的历史交易数据,超越现有行业方法。
- 通过先进的特征工程提升模型精度,减少对24/7监控中心中高成本人工分析师的依赖。
- 评估是否需要实时特征计算,还是周期性更新(如每日或每周)即可实现高性能。
- 评估在跨国大型银行中大规模部署高精度欺诈检测模型在财务和运营上的影响。
提出的方法
- 使用深度特征合成(DFS)自动为每张卡生成237个特征——其中100多个为行为模式——基于历史交易数据。
- 使用特征原语(如求和、均值、计数、标准差及时间相关聚合,例如交易间平均时间)推导出有意义的行为指标。
- 采用基于生成特征训练的随机森林分类器进行欺诈预测,确保可解释性并避免黑箱建模。
- 通过Featuretools库实现特征近似,允许特征计算延迟(例如7、21或35天),以降低计算成本。
- 调整模型的决策阈值以平衡精确率与召回率,对高价值交易单独调优,以改善财务结果。
- 使用精确率、F1分数和总成本(含误报惩罚)等指标评估模型性能,比较不同近似间隔的表现。
实验结果
研究问题
- RQ1自动化特征工程是否能在无需实时特征计算的情况下,显著降低大规模欺诈检测中的误报率?
- RQ2特征近似(如每7、21或35天更新一次)在多大程度上会降低模型性能,同时仍保持高精确率与高召回率?
- RQ3在真实银行环境中,减少误报的财务影响如何,特别是当高价值交易在决策阈值中被赋予更高权重时?
- RQ4基于丰富历史行为特征的模型是否优于某家主要跨国银行现有生产系统?
- RQ5是否可以仅通过周期性特征更新而非流式计算来有效部署系统,从而降低基础设施成本?
主要发现
- 所提模型在185.2万笔未见交易的数据集上将误报减少了54%,节省19万欧元。
- 即使特征仅每35天计算一次,模型仍保持0.236的精确率和0.373的F1分数,与每日更新相比性能无显著下降。
- 当阈值调整以优先考虑高价值交易时,模型在真正阳性率≥0.89时达到0.236的精确率,且在更长的近似间隔下精确率未下降。
- 当特征每35天更新一次时,误报的财务成本约增加6.7万欧元,但被模型更高的精确率和更低的运营负担所抵消。
- 通过特征近似,模型将特征计算时间减少了67%,实现了更快的迭代与部署,且未牺牲准确性。
- 该解决方案表明,实时流式计算对高精度欺诈检测并非必需,周期性特征更新(如每周)已足够维持优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。