Skip to main content
QUICK REVIEW

[논문 리뷰] The Importance of Future Information in Credit Card Fraud Detection

Van Bach Nguyen, Kanishka Ghosh Dastidar|arXiv (Cornell University)|2022. 04. 11.
Imbalanced Data Classification Techniques인용 수 10
한 줄 요약

이 논문은 인간 검증 지연으로 인해 거래 후 1일 이내로 이용 가능한 향후 거래 데이터를 활용하여, 양방향 LSTM(Bi-LSTM)을 사용해 후행적 신용카드 사기 탐지 정확도를 향상시키는 새로운 사기 탐지 프레임워크를 제안한다. 이 방법은 단지 과거 정보에 의존하는 표준 LSTMs보다 더 많은 사기 거래, 손상된 카드, 그리고 더 이른 시점의 사기 사례를 탐지하며, 4-1-2 Bi-LSTM 설정에서 집계된 특징을 사용해 AUCPR 0.403 ± 0.021의 성능을 기록한다.

ABSTRACT

Fraud detection systems (FDS) mainly perform two tasks: (i) real-time detection while the payment is being processed and (ii) posterior detection to block the card retrospectively and avoid further frauds. Since human verification is often necessary and the payment processing time is limited, the second task manages the largest volume of transactions. In the literature, fraud detection challenges and algorithms performance are widely studied but the very formulation of the problem is never disrupted: it aims at predicting if a transaction is fraudulent based on its characteristics and the past transactions of the cardholder. Yet, in posterior detection, verification often takes days, so new payments on the card become available before a decision is taken. This is our motivation to propose a new paradigm: posterior fraud detection with "future" information. We start by providing evidence of the on-time availability of subsequent transactions, usable as extra context to improve detection. We then design a Bidirectional LSTM to make use of these transactions. On a real-world dataset with over 30 million transactions, it achieves higher performance than a regular LSTM, which is the state-of-the-art classifier for fraud detection that only uses the past context. We also introduce new metrics to show that the proposal catches more frauds, more compromised cards, and based on their earliest frauds. We believe that future works on this new paradigm will have a significant impact on the detection of compromised cards.

연구 동기 및 목표

  • 사람의 검증 지연으로 인해 거래 후 1일 이내로 이용 가능한 향후 거래 데이터가 후행적 신용카드 사기 탐지 성능 향상에 기여할 수 있는지 조사하기 위해
  • 과거와 향후 거래 시퀀스를 효과적으로 통합하여 향상된 사기 분류 성능을 달성하는 Bi-LSTM 모델을 설계하기 위해
  • 향후 정보의 영향을 통해 더 많은 사기 거래, 손상된 카드, 더 이른 시점의 사기 사례를 탐지하는 데 미치는 영향을 평가하기 위해
  • 다양한 시퀀스 설정 하에서 최신 기술 모델인 LSTM 및 랜덤 포레스트와의 성능 비교를 통해 제안된 Bi-LSTM의 성능을 평가하기 위해
  • 최대 탐지 성능을 달성하기 위해 과거와 향후 컨텍스트 길이 사이의 최적의 균형을 도출하기 위해

제안 방법

  • 저자는 목표 거래 주변의 과거 및 향후 컨텍스트를 모두 포함하는 거래 시퀀스를 처리하는 양방향 LSTM(Bi-LSTM) 아키텍처를 사용한다.
  • 모델은 글로벌 결제 제공업체의 3,000만 건 이상의 실세계 거래 데이터셋에서 훈련되었으며, 시퀀스는 설정 가능한 과거 및 향후 거래 수로 정의된다(예: 4-1-2: 과거 4건, 대상 1건, 향후 2건).
  • 특징 공학은 기본 거래 특징과 과거 및 향후 시퀀스에 대한 집계 통계(예: 합계, 개수, 평균)를 포함하여 컨텍스트를 풍부하게 한다.
  • 모델 평가는 AUCPR, F1-score, AUC와 같은 표준 사기 탐지 지표를 사용하며, 손상된 카드의 첫 번째 사기 탐지에 중점을 둔다.
  • 제거 분석을 통해 다양한 시퀀스 설정(예: 4-1-0 대비 4-1-2)과 모델 유형(LSTM 대비 Bi-LSTM 대비 랜덤 포레스트)을 비교하여 향후 정보의 영향을 분리한다.
  • 집계된 특징의 유무에 따라 Bi-LSTM를 추가로 평가하여 성능 향상에 기여하는 역할을 평가한다.

실험 결과

연구 질문

  • RQ1거래 후 1일 이내로 이용 가능한 향후 거래 데이터가 후행적 사기 탐지 성능 향상에 기여할 수 있는가?
  • RQ2과거와 향후 거래 시퀀스를 모두 활용하는 Bi-LSTM가 단지 과거 컨텍스트만 사용하는 표준 LSTMs보다 성능이 뛰어나게 되는가?
  • RQ3사기 탐지 성능 측면에서 과거와 향후 컨텍스트 길이 사이의 최적 균형은 무엇인가?
  • RQ4집계된 거래 특징의 포함 여부가 이른 시점의 사기 및 손상된 카드 탐지에 어떤 영향을 미치는가?
  • RQ5Bi-LSTM 모델이 최신 기술 모델보다 더 많은 사기 거래와 더 이른 사기 사례를 탐지할 수 있는가?

주요 결과

  • 4-1-2 설정(과거 4건, 대상 1건, 향후 2건)을 사용한 Bi-LSTM는 집계된 특징에서 AUCPR 0.403 ± 0.021의 성능을 기록하며, LSTM 기준선 및 랜덤 포레스트보다 유의미하게 뛰어난 성능을 보였다.
  • 과거와 향후 컨텍스트 길이가 균형 잡힌 설정(2-1-2)이 모든 지표에서 최고 성능을 기록하여, 양측에서 동일한 길이의 컨텍스트가 최적임을 시사한다.
  • 단지 두 개의 향후 거래만으로도 Bi-LSTM 모델이 과거 컨텍스트만 사용하는 모델보다 더 많은 사기 거래와 손상된 카드를 탐지했다.
  • 기준선 모델보다 더 이른 시점에 카드의 첫 번째 사기를 탐지하여 재정적 손실을 최소화하는 데 핵심적인 역할을 했다.
  • 집계된 특징의 사용은 모든 모델에서 성능 향상을 가져왔으며, 첫 번째 사기 탐지에서 가장 큰 성과를 기록했다.
  • 짧은 Bi-LSTM 시퀀스(2-1-2)가 더 긴 LSTM 시퀀스(9-1-0)와 비교해 유사하거나 더 뛰어난 성능을 기록하여 효율성과 낮은 데이터 의존도를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.