Skip to main content
QUICK REVIEW

[논문 리뷰] Application of Deep Reinforcement Learning to Payment Fraud

Siddharth Vimal, Kanishka Kayathwal|arXiv (Cornell University)|2021. 12. 08.
Imbalanced Data Classification Techniques인용 수 6
한 줄 요약

이 논문은 지ay한 강화학습(DRL) 프레임워크를 제안하여 결제 사기 탐지 문제를 순차적 유틸리티 최적화 문제로 재구성하며, 사기 탐지와 정상 거래 승인 간의 균형을 맞추기 위해 고유의 보상 함수를 사용한다. DQNR 에이전트는 두 개의 공개 데이터셋에서 기존 분류기들을 능가하며, 클래스 불균형과 분포 이동에 대해 강건성을 유지하면서도 뛰어난 유틸리티 지표를 달성한다.

ABSTRACT

The large variety of digital payment choices available to consumers today has been a key driver of e-commerce transactions in the past decade. Unfortunately, this has also given rise to cybercriminals and fraudsters who are constantly looking for vulnerabilities in these systems by deploying increasingly sophisticated fraud attacks. A typical fraud detection system employs standard supervised learning methods where the focus is on maximizing the fraud recall rate. However, we argue that such a formulation can lead to sub-optimal solutions. The design requirements for these fraud models requires that they are robust to the high-class imbalance in the data, adaptive to changes in fraud patterns, maintain a balance between the fraud rate and the decline rate to maximize revenue, and be amenable to asynchronous feedback since usually there is a significant lag between the transaction and the fraud realization. To achieve this, we formulate fraud detection as a sequential decision-making problem by including the utility maximization within the model in the form of the reward function. The historical decline rate and fraud rate define the state of the system with a binary action space composed of approving or declining the transaction. In this study, we primarily focus on utility maximization and explore different reward functions to this end. The performance of the proposed Reinforcement Learning system has been evaluated for two publicly available fraud datasets using Deep Q-learning and compared with different classifiers. We aim to address the rest of the issues in future work.

연구 동기 및 목표

  • 사용자 지능형 감지 모델이 유틸리티 최적화를 우선시하지 않는 전통적인 지도 학습 기반 사기 탐지 모델의 한계를 해결하기 위해.
  • 장기적인 금융 유틸리티를 최적화하기 위해 지연 강화학습을 활용해 사기 탐지를 순차적 결정 문제로 재구성하기 위해.
  • 실제 세계의 사기 데이터셋에서 유틸리티 기반 보상 함수를 갖춘 DRL 에이전트의 성능을 평가하여, 금전적 결과와 사기 탐지 및 정상 거래 기각 간의 균형에 중점을 두기 위해.
  • 데이터 불균형과 지연된 피드백 상황에서 적응적이고 강건한 사기 탐지에 DRL을 활용할 수 있는 가능성을 입증하기 위해.
  • 향후 실시간 사기 시스템에서 비정상성, 이종 피드백, 반사적 조건을 다루기 위한 기초를 마련하기 위해.

제안 방법

  • 사기 탐지 문제를 상태가 이전 사기 발생률과 기각률로 정의되는 마르코프 결정 과정(MDP)으로 모델링하며, 행동 공간은 거래 승인 또는 기각으로 구성된다.
  • 사용자 정의 보상 함수를 사용하여 딥 Q넷(DQN) 에이전트를 훈련시키며, 이는 사기 탐지와 정상 거래 승인 간의 균형을 맞추는 데 기여한다.
  • 보상 함수는 비사기 승인, 사기 탐지, 과도한 기각에 대한 벌점의 가중 조합으로 정의되며, 하이퍼파라미터 α와 β는 수익과 리스크 간의 트레이드오���을 조정한다.
  • DQNR 에이전트는 이브레인-시스(ECD)와 같은 두 개의 공개 데이터셋을 사용하여 이터레이티브 훈련 방식으로 훈련되며, 이는 이전 거래 통계에서 유도된 상태 표현을 기반으로 한다.
  • 하이퍼파라미터 튜닝을 통해 β의 영향을 분석하여 승인 비율, 비사기 기각, 사기 기각에 영향을 주며, 리스크 조정된 행동을 가능하게 한다.
  • 표준 지표(정밀도, 재현율, F1)와 금전적 지표(승인/기각 금액)를 사용하여 성능을 평가하며, XGBoost 및 기타 분류기와의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트는 지연 강화학습을 통해 사기 탐지와 정상 거래 승인 간의 균형을 효과적으로 유지하여 지불 사기 탐지에서 재무 유틸리티를 최대화할 수 있는가?
  • RQ2보상 함수의 설계가 에이전트가 높은 유틸리티를 유지하면서도 정상 거래의 기각을 최소화하는 데 미치는 영향은 어떠한가?
  • RQ3DQNR 에이전트는 불균형한 사기 데이터셋에서 전통적인 지도 학습 기반 분류기인 XGBoost와 비교해 유틸리티, 정밀도, 재현율, 금전적 결과 측면에서 어떻게 성능을 내는가?
  • RQ4DRL 프레임워크는 분포 이동에 얼마나 잘 적응하여 장기간에 걸쳐 안정적인 성능을 유지할 수 있는가, 특히 개념 이동 상황에서의 성능은 어떠한가?
  • RQ5β와 같은 하이퍼파라미터는 에이전트의 리스크 수용 능력과 승인 및 기각 비율 측면에서 운영 행동에 어떤 영향을 미치는가?

주요 결과

  • DQNR 에이전트는 평가된 모든 모델 중에서 ECD 데이터셋에서 가장 높은 유틸리티 점수를 기록했으며, XGBoost 및 기타 분류기들을 능가했다.
  • IEEE 데이터셋에서는 DQNR 에이전트가 96.0%의 높은 승인 비율을 유지하면서도 사기 재현율 41%와 F1 점수 38%를 달성하여 탐지와 승인 간의 균형이 뛰어나다는 것을 입증했다.
  • 에피소드 전반에 걸쳐 DQNR 에이전트는 기각 비율과 사기 탐지 성능에서 뛰어난 안정성을 보였으며, 특히 불안정한 행동을 보인 IEEE 데이터셋에서 DQNR’ 및 DQNR”보다 뛰어난 성능을 보였다.
  • 금전적 지표 측면에서 DQNR 에이전트는 다른 모델들보다 비사기 승인에서 더 높은 금액을 창출했으며, 특히 ECD 데이터셋에서 사기 탐지 결과도 더 우수했다.
  • 하이퍼파라미터 β는 조정 가능한 리스크 제어를 제공했다: 낮은 β 값은 승인 비율을 높이고 정상 거래 기각을 줄였으며, 높은 β 값은 사기 탐지 성능을 향상시키기 위해 더 많은 기각을 수반했다.
  • DQNR 에이전트는 분포 이동에 대해 강건성을 보였으며, 훈련 에피소드 전반에 걸쳐 안정된 성능을 유지함으로써 스트리밍 및 실시간 환경에서의 구현 가능성을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.