Skip to main content
QUICK REVIEW

[论文解读] Application of Deep Reinforcement Learning to Payment Fraud

Siddharth Vimal, Kanishka Kayathwal|arXiv (Cornell University)|Dec 8, 2021
Imbalanced Data Classification Techniques被引用 6
一句话总结

本文提出了一种用于支付欺诈检测的深度强化学习(DRL)框架,将欺诈决策制定为序列效用最大化问题,采用自定义奖励函数以平衡欺诈检测与正常交易审批。DQNR智能体在两个公开数据集上优于传统分类器,实现了更优的效用指标,同时对类别不平衡和分布偏移保持鲁棒性。

ABSTRACT

The large variety of digital payment choices available to consumers today has been a key driver of e-commerce transactions in the past decade. Unfortunately, this has also given rise to cybercriminals and fraudsters who are constantly looking for vulnerabilities in these systems by deploying increasingly sophisticated fraud attacks. A typical fraud detection system employs standard supervised learning methods where the focus is on maximizing the fraud recall rate. However, we argue that such a formulation can lead to sub-optimal solutions. The design requirements for these fraud models requires that they are robust to the high-class imbalance in the data, adaptive to changes in fraud patterns, maintain a balance between the fraud rate and the decline rate to maximize revenue, and be amenable to asynchronous feedback since usually there is a significant lag between the transaction and the fraud realization. To achieve this, we formulate fraud detection as a sequential decision-making problem by including the utility maximization within the model in the form of the reward function. The historical decline rate and fraud rate define the state of the system with a binary action space composed of approving or declining the transaction. In this study, we primarily focus on utility maximization and explore different reward functions to this end. The performance of the proposed Reinforcement Learning system has been evaluated for two publicly available fraud datasets using Deep Q-learning and compared with different classifiers. We aim to address the rest of the issues in future work.

研究动机与目标

  • 解决传统监督欺诈检测模型优先考虑召回率而非效用最大化的局限性。
  • 将欺诈检测建模为使用深度强化学习的序列决策问题,以优化长期财务效用。
  • 评估具有基于效用奖励函数的DRL智能体在真实世界欺诈数据集上的性能,重点关注货币结果以及欺诈检测与正常交易拒绝之间的平衡。
  • 证明在数据不平衡和延迟反馈背景下,使用DRL实现自适应、鲁棒的欺诈检测的可行性。
  • 为未来研究处理实时欺诈系统中的非平稳性、异步反馈和反事实问题奠定基础。

提出的方法

  • 将欺诈检测问题建模为马尔可夫决策过程(MDP),其中状态由历史欺诈率和拒绝率定义,动作空间包括批准或拒绝交易。
  • 使用自定义奖励函数训练深度Q网络(DQN)智能体,该函数结合交易效用,平衡欺诈检测与正常交易审批。
  • 奖励函数定义为非欺诈批准、欺诈检测和过度拒绝惩罚的加权组合,超参数α和β用于调节收益与风险之间的权衡。
  • 在两个公开数据集——IEEE-CIS和ECD上训练DQNR智能体,采用基于历史交易统计信息的状态表示进行回合制训练。
  • 通过超参数调优分析β对审批率、非欺诈拒绝率和欺诈拒绝率的影响,实现风险调整后的行为。
  • 使用标准指标(精确率、召回率、F1)和货币指标(批准与拒绝的金额)评估性能,并与XGBoost及其他分类器进行比较。

实验结果

研究问题

  • RQ1深度强化学习智能体能否在支付欺诈检测中有效平衡欺诈检测与正常交易审批,以实现最大财务效用?
  • RQ2奖励函数的设计在多大程度上影响智能体在最小化合法交易拒绝的同时维持高效益的能力?
  • RQ3与XGBoost等传统监督分类器相比,DQNR智能体在不平衡欺诈数据集上的效用、精确率、召回率和货币结果方面表现如何?
  • RQ4DRL框架在面对概念漂移时,多大程度上能够适应分布偏移并保持随时间的稳定性能?
  • RQ5超参数β如何影响智能体的风险偏好及其在审批率和拒绝率方面的操作行为?

主要发现

  • 在ECD数据集上,DQNR智能体在所有评估模型中实现了最高的效用得分,优于XGBoost及其他分类器。
  • 在IEEE数据集上,DQNR智能体在保持96.0%高审批率的同时,实现了41%的欺诈召回率和38%的F1分数,展现出检测与审批之间的良好平衡。
  • 在各轮次中,DQNR智能体在拒绝率和欺诈检测性能方面表现出更优的稳定性,尤其在IEEE数据集上显著优于DQNR’和DQNR”(后者表现出不稳定行为)。
  • 在货币指标方面,DQNR智能体产生的非欺诈批准金额更高,欺诈检测结果也更优,尤其在ECD数据集上表现突出。
  • 超参数β提供了可调节的风险控制:较低的β值可提高审批率并减少合法交易的拒绝,而较高的β值则通过增加拒绝数量提升欺诈检测能力。
  • DQNR智能体对分布偏移表现出鲁棒性,其在各训练轮次中性能稳定,表明其在流式、实时环境中的部署潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。