Skip to main content
QUICK REVIEW

[論文レビュー] Application of Deep Reinforcement Learning to Payment Fraud

Siddharth Vimal, Kanishka Kayathwal|arXiv (Cornell University)|Dec 8, 2021
Imbalanced Data Classification Techniques被引用数 6
ひとこと要約

本稿は、不正検出と正当取引の承認のバランスを取るためにカスタム報酬関数を用いた、支払い不正検出のための深層強化学習(DRL)フレームワークを提案する。DQNRエージェントは2つの公開データセットにおいて、従来の分類器を上回る性能を示し、クラスの不均衡や分布シフトに対しても頑健である優れた有用性指標を達成した。

ABSTRACT

The large variety of digital payment choices available to consumers today has been a key driver of e-commerce transactions in the past decade. Unfortunately, this has also given rise to cybercriminals and fraudsters who are constantly looking for vulnerabilities in these systems by deploying increasingly sophisticated fraud attacks. A typical fraud detection system employs standard supervised learning methods where the focus is on maximizing the fraud recall rate. However, we argue that such a formulation can lead to sub-optimal solutions. The design requirements for these fraud models requires that they are robust to the high-class imbalance in the data, adaptive to changes in fraud patterns, maintain a balance between the fraud rate and the decline rate to maximize revenue, and be amenable to asynchronous feedback since usually there is a significant lag between the transaction and the fraud realization. To achieve this, we formulate fraud detection as a sequential decision-making problem by including the utility maximization within the model in the form of the reward function. The historical decline rate and fraud rate define the state of the system with a binary action space composed of approving or declining the transaction. In this study, we primarily focus on utility maximization and explore different reward functions to this end. The performance of the proposed Reinforcement Learning system has been evaluated for two publicly available fraud datasets using Deep Q-learning and compared with different classifiers. We aim to address the rest of the issues in future work.

研究の動機と目的

  • 従来の教師あり不正検出モデルが有用性の最大化よりも再現率を重視するという限界を是正すること。
  • 深層強化学習を用いて不正検出を段階的意思決定問題として定式化し、長期的な財務的有用性を最適化すること。
  • 実世界の不正検出データセットにおいて、有用性に基づく報酬関数を有するDRLエージェントの性能を評価し、金銭的結果と不正検出と正当取引の不承認のバランスに注目すること。
  • データの不均衡や遅延フィードバックの下でも、DRLを用いた適応的で頑健な不正検出の実現可能性を示すこと。
  • 今後の非ステーショナリティ、非同期フィードバック、反事実的推論を扱うリアルタイム不正検出システムの基盤を提供すること。

提案手法

  • 不正検出問題は、履歴的な不正率と不承認率を状態として定義するマーカフ決定過程(MDP)としてモデル化され、行動空間は取引の承認または不承認である。
  • 取引の有用性を組み込んだカスタム報酬関数を用いて、深層Qネットワーク(DQN)エージェントを訓練し、不正検出と正当取引の承認のバランスを取る。
  • 報酬関数は、非不正取引の承認、不正検出、および過剰な不承認に対するペナルティの重み付き組み合わせとして定義され、ハイパーパramータ α と β が収益とリスクのトレードオフを調整する。
  • DQNRエージェントは、履歴取引統計から導出される状態表現を用いて、2つの公開データセット(IEEE-CIS および ECD)でエピソードトレーニングにより訓練された。
  • ハイパーパramータチューニングを実施し、β の影響が承認率、非不正取引の不承認、不正取引の不承認に与える影響を分析し、リスク調整された行動を可能にする。
  • 標準指標(適合率、再現率、F1スコア)と金銭的指標(承認/不承認の金額)を用いて性能を評価し、XGBoost および他の分類器と比較した。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、支払い不正検出において、不正検出と正当取引承認のバランスを効果的に取り、財務的有用性を最大化できるか?
  • RQ2報酬関数の設計は、正当取引の不承認を最小限に抑えながら、エージェントの有用性を維持する能力にどのように影響するか?
  • RQ3不均衡な不正データセットにおいて、DQNRエージェントはXGBoostなどの従来の教師あり分類器と比較して、有用性、適合率、再現率、金銭的結果の観点でどのように性能を発揮するか?
  • RQ4DRLフレームワークは、分布シフトにどの程度適応可能で、特にコンセプトドリフトの下でも安定した性能を維持できるか?
  • RQ5β などのハイパーパrameterは、エージェントのリスク志向性と承認率・不承認率という運用行動にどのように影響を与えるか?

主な発見

  • DQNRエージェントは、ECDデータセットにおいて、評価されたすべてのモデルの中で最高の有用性スコアを達成し、XGBoost や他の分類器を上回った。
  • IEEEデータセットでは、DQNRエージェントは96.0%の高い承認率を維持しながら、41%の不正再現率と38%のF1スコアを達成し、検出と承認のバランスに優れた性能を示した。
  • DQNRエージェントは、エピソード全体にわたり、不承認率と不正検出性能の両面で優れた安定性を示した。特に、IEEEデータセットでは、DQNR’ や DQNR” と比較して、より良好な性能を発揮した。
  • 金銭的指標では、DQNRエージェントは非不正取引承認からの高い金額を生み出し、他のモデルと比較して不正検出の結果も優れており、特にECDデータセットで顕著だった。
  • ハイパーパrameter β は、調整可能なリスク制御を提供した:β の値が低いほど承認率が上昇し、正当取引の不承認が減少したが、逆にβ を高くすると不正検出性能が向上したが、不承認が増加した。
  • DQNRエージェントは、分布シフトに対しても頑健であることが実証された。訓練エピソード全体にわたり安定した性能を示したため、ストリーミングやリアルタイム環境への導入が可能であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。